{"as_of":"2026-08-12T22:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cef8d4b9b964840f1b7989215c2ab399927a27eb9d3bdc455824b90338f0678b","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:27:14.740756Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11047/citation-record","integrity":"/paper/2608.11047/integrity","json":"/paper/2608.11047/citation-record.json","paper":"/paper/2608.11047"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.809735Z","title":"Royal Society Open Science , author =","venue":null,"work_id":"4555e77c-651e-4dcc-aa2f-c772db9bc6ae","year":2021},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.465181Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:3cf6b0257bdde003767718690d46e038da0ad40b2ecd5cf492a6abc20b7f62d8","observation_id":"a82a223f-ce73-4e1a-86c8-524e11e4605b","resolution":{"observed_at":"2026-08-12T11:27:15.814555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.794428Z","title":null,"venue":null,"work_id":"618fb6d5-441b-4dda-b151-e9c2b72fc706","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.472921Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:10332bead083b6e1b039dea538a88d83de73b8b0574362f3ebbdfcc49f21e515","observation_id":"18c20d07-9891-43d6-8914-389ee9b160c2","resolution":{"observed_at":"2026-08-12T11:27:15.799168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.778410Z","title":"Journal of Financial Data Science , author =","venue":null,"work_id":"c8c6b3e8-9e09-4f49-9f82-8089b0784afd","year":2023},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.478110Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:16a09c9e0c476b9c70ff31be8b9828e3974a37fc2fb52632f945e69730ac204f","observation_id":"d3d4b963-4817-483b-ad8c-f8a3a56859bd","resolution":{"observed_at":"2026-08-12T11:27:15.784013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-12T11:27:14.482978Z","title":"doi:10.48550/arXiv.2410.05229 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.482978Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:1df02688645dbae8e438a859d0f7bc769d628be516bc8e5544bb14ffb77ccacd","observation_id":"21207e7a-cb1e-403f-a346-6a4f00d03b27","resolution":{"observed_at":"2026-08-12T11:27:14.482978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.762591Z","title":"and Schärli, Nathanael and Zhou, Denny , month = jul, year =","venue":null,"work_id":"0929e4a8-8771-4f06-95cd-c95214527e7c","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.488851Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:d50c9a2c008b77375bbeb5cba1c428bf4c616b37c10a3dec9725467ed6f775b8","observation_id":"1be2fae3-78d6-474f-b0d8-ca1693951683","resolution":{"observed_at":"2026-08-12T11:27:15.768285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.494069Z","title":"Proceedings of the 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.494069Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:3f8b19383adcc7a8655b9442840eb8d59275a5c2845d02b61b4e293dcc7cb69f","observation_id":"8a2e1531-9206-4fea-8023-4fd74050eb7a","resolution":{"observed_at":"2026-08-12T11:27:14.494069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.499162Z","title":"Proceedings of the 61st","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.499162Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:c1dc7ed2ad6cef4496b0ad3f1617b729244d0fe91a503ba4bceee28b59887161","observation_id":"11901028-0c03-4170-a2d9-03d864c444ab","resolution":{"observed_at":"2026-08-12T11:27:14.499162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.504228Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.504228Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a82f61fa01aa54642161703ef9be96329e6b4659cd2a60b5fdc761e8d03a5cb9","observation_id":"8275cf26-577b-4e5c-90f2-ee5a54ca28ed","resolution":{"observed_at":"2026-08-12T11:27:14.504228Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-12T11:27:14.508896Z","title":"Least-to-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.508896Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a4fba03cb460cbe0b311d8b031e0c0d3253fce3f7e28201a0681286ec04d373d","observation_id":"638d1d04-55ae-4633-9f53-0766c56e991e","resolution":{"observed_at":"2026-08-12T11:27:14.508896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.737879Z","title":"arXiv.org , author =","venue":null,"work_id":"d0cd4766-558c-4522-bdc4-b8f81fee87b3","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.514276Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:60d824b107966fda4405a530f0e29ef5462180c083e6c4cdc8680d3f00dd2773","observation_id":"6070be9a-045b-4b3d-b50c-a1f8e4f02ad1","resolution":{"observed_at":"2026-08-12T11:27:15.742432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.722543Z","title":null,"venue":null,"work_id":"07120885-a83b-4f3c-8424-8eb67ebc26e9","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.519444Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:41bbe17c0ec1fb8dd58959f6ed574a7b09328a24f42212bb62152f0286f727c7","observation_id":"295d2c15-6841-4434-89b4-817a26a17ff7","resolution":{"observed_at":"2026-08-12T11:27:15.727400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.523907Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.523907Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a00f2edb881d88894f186579478c4f7b6ce0b34caeb419f255688379a21a18c5","observation_id":"d68f7240-e2a6-436b-881e-57c7c7fcb871","resolution":{"observed_at":"2026-08-12T11:27:14.523907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.528646Z","title":"State of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.528646Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:bb8d7b7e07f8892b91853a505c0b4afc5310c71f3e20372a56e3a7e2c4b50724","observation_id":"6dc34919-0876-49ad-8c58-b9e45926ec96","resolution":{"observed_at":"2026-08-12T11:27:14.528646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15647","last_updated":"2024-11-22T05:02:26Z","snapshot_observed_at":"2026-08-10T12:34:50.580036Z","submitted_at":"2023-03-28T00:06:38Z","title":"Scaling Down to Scale Up: A Guide to Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15647","snapshot_observed_at":"2026-08-12T11:27:14.533197Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.533197Z"},"links":{"cited_paper":"/paper/2303.15647","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:e2a514c15ede4cd4bfcb05ace04e464efa6ea3ae7c44d38e4667c27309a0e2f1","observation_id":"b1df4501-1674-4086-84be-0c3ad29511a4","resolution":{"observed_at":"2026-08-12T11:27:14.533197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01933","last_updated":"2023-10-09T15:38:46Z","snapshot_observed_at":"2026-08-09T04:45:14.956800Z","submitted_at":"2023-04-04T16:31:37Z","title":"LLM-Adapters: An Adapter Family for Parameter-Efficient Fine-Tuning of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01933","snapshot_observed_at":"2026-08-12T11:27:14.538468Z","title":"doi:10.48550/arXiv.2304.01933 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.538468Z"},"links":{"cited_paper":"/paper/2304.01933","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:f8775879f89f1f18579c3096bfc19115bc08d5a2981b13a2b39d84697ac1dfa7","observation_id":"2e070690-7432-4f89-9411-eadca9a51fac","resolution":{"observed_at":"2026-08-12T11:27:14.538468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.00751","last_updated":"2019-06-13T17:48:30Z","snapshot_observed_at":"2026-07-06T07:30:44.870185Z","submitted_at":"2019-02-02T16:29:47Z","title":"Parameter-Efficient Transfer Learning for NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.00751","snapshot_observed_at":"2026-08-12T11:27:14.543528Z","title":"Parameter-","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.543528Z"},"links":{"cited_paper":"/paper/1902.00751","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:95a7b45e56eb575303d339f267a89d1e7f2e395f8967a42fcc21dbe15c2bffb9","observation_id":"9a7d4f31-e938-485a-b948-ddb02759a5a4","resolution":{"observed_at":"2026-08-12T11:27:14.543528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T11:27:14.548592Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.548592Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:aa7117a7404ac46b94c6aedff9d26b85f592232f1896ad7a66b85b6e9cf10978","observation_id":"1fa46fb9-7413-44e4-8bdf-539da2ea1bae","resolution":{"observed_at":"2026-08-12T11:27:14.548592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18654","last_updated":"2023-10-31T16:35:07Z","snapshot_observed_at":"2026-08-06T15:30:28.043264Z","submitted_at":"2023-05-29T23:24:14Z","title":"Faith and Fate: Limits of Transformers on Compositionality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18654","snapshot_observed_at":"2026-08-12T11:27:14.554690Z","title":"and Sanyal, Soumya and Welleck, Sean and Ren, Xiang and Ettinger, Allyson and Harchaoui, Zaid and Choi, Yejin , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.554690Z"},"links":{"cited_paper":"/paper/2305.18654","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:776b92eff88b20f7c6453eb7626622e488a02621771ebce16c4a075a51d2cadc","observation_id":"f8aa8649-599e-4745-9a40-a696840490cf","resolution":{"observed_at":"2026-08-12T11:27:14.554690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.559559Z","title":"Compositional","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.559559Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a7a8e0ad8bb5efa0cf22c60990b81f9afc6dc4fda9d241f4188df0fb98c17ab6","observation_id":"8cfed1da-fdef-44d5-9985-0b5c4f905fae","resolution":{"observed_at":"2026-08-12T11:27:14.559559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.564906Z","title":"Findings of the","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.564906Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:99fc7a9c4dad5ec4e20bcb97a5cb4cb8334191834c9692c08177c6c7c32be456","observation_id":"dd3966e0-d8c0-4322-870a-048d2854dae9","resolution":{"observed_at":"2026-08-12T11:27:14.564906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-08T18:43:29.715488Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-12T11:27:14.569773Z","title":"doi:10.48550/arXiv.2309.17167 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.569773Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:c8eed52a80e8c918e056b4b7a2ba8cb48db97e35d1627e5c9748a707d63eb1d9","observation_id":"91bf9fc0-82d3-427b-aa8d-ebad0bdf38b9","resolution":{"observed_at":"2026-08-12T11:27:14.569773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06602","last_updated":"2024-03-12T16:54:57Z","snapshot_observed_at":"2026-08-09T01:42:54.154448Z","submitted_at":"2023-11-11T16:16:11Z","title":"BizBench: A Quantitative Reasoning Benchmark for Business and Finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06602","snapshot_observed_at":"2026-08-12T11:27:14.574849Z","title":"doi:10.48550/arXiv.2311.06602 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.574849Z"},"links":{"cited_paper":"/paper/2311.06602","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:5f9fdd92641b719c54e3bbd494fcc8ad9cd2b8f5a12a3726ce312c3938c534a8","observation_id":"24d6dea3-d680-4ed2-ad79-01097e3172ee","resolution":{"observed_at":"2026-08-12T11:27:14.574849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01347","last_updated":"2022-06-03T00:24:35Z","snapshot_observed_at":"2026-08-05T11:38:03.015062Z","submitted_at":"2022-06-03T00:24:35Z","title":"MultiHiertt: Numerical Reasoning over Multi Hierarchical Tabular and Textual Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01347","snapshot_observed_at":"2026-08-12T11:27:14.579823Z","title":"doi:10.48550/arXiv.2206.01347 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.579823Z"},"links":{"cited_paper":"/paper/2206.01347","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a3c651812662260d68c84a1b9ee02b0ed674639d372f58ffefe607832b69adad","observation_id":"7f11c845-30cd-4694-ad99-33752ee8ad1e","resolution":{"observed_at":"2026-08-12T11:27:14.579823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T11:27:14.584718Z","title":", month = nov, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.584718Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:1b57b723ba8d7742b0925985266c15315d637da5f9ee492fcf34ad8795866eb4","observation_id":"ce0b6129-7434-4486-baee-307b062af219","resolution":{"observed_at":"2026-08-12T11:27:14.584718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.590042Z","title":"Findings of the","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.590042Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:fe0ee66e01692bf1095aa8e31cb23e8f711abfe82e40482c2fa3f6c4ba6a5390","observation_id":"d8e4b936-32ed-49d7-8968-d03e5810c415","resolution":{"observed_at":"2026-08-12T11:27:14.590042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-10T16:21:51.911168Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-12T11:27:14.594944Z","title":"doi:10.48550/arXiv.1909.02164 , abstract =","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.594944Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:649b92f2fa087f450c17cbe1e01a6b8932e01ac5b84cb47b082d9ca1f7fbe519","observation_id":"a4c2a1a7-ee44-4d37-8fbb-5b987b6af374","resolution":{"observed_at":"2026-08-12T11:27:14.594944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.25160","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.420250Z","title":"doi:10.48550/arXiv.2509.25160 , abstract =","venue":null,"work_id":"0fe3cb8e-dc7e-4ff6-8ab3-7f879aff6ae3","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.600117Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:fb58af1a20a702ff05f99d299303781005da96408b775940990996899578c063","observation_id":"f1adfcf5-f805-47ce-beca-cfd2b880a6bb","resolution":{"observed_at":"2026-08-12T11:27:15.425169Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-12T11:27:14.604742Z","title":"doi:10.48550/arXiv.1903.00161 , abstract =","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.604742Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:14fa5c3acb1310536f2443b125f98a91e2f44dd4c7847021648de47bcf09c6ea","observation_id":"e3a3cd35-f541-4820-a96e-53553c5be3c1","resolution":{"observed_at":"2026-08-12T11:27:14.604742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.07624","last_updated":"2021-06-01T05:38:50Z","snapshot_observed_at":"2026-08-12T20:59:46.367520Z","submitted_at":"2021-05-17T06:12:06Z","title":"TAT-QA: A Question Answering Benchmark on a Hybrid of Tabular and Textual Content in Finance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.07624","snapshot_observed_at":"2026-08-12T11:27:14.609994Z","title":"doi:10.48550/arXiv.2105.07624 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.609994Z"},"links":{"cited_paper":"/paper/2105.07624","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:50262c06f458e17b9474025fdca77cd0ac4a6d141c685260cf6a6f77484a2d24","observation_id":"42a7500a-9b27-4ba5-b9bb-d96447bfe60d","resolution":{"observed_at":"2026-08-12T11:27:14.609994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06142","last_updated":"2021-06-11T02:59:54Z","snapshot_observed_at":"2026-07-06T11:18:12.900336Z","submitted_at":"2021-06-11T02:59:54Z","title":"DORO: Distributional and Outlier Robust Optimization","version":1},"cited_work":{"arxiv_id":"2106.06142","doi":"10.48550/arxiv.2106.06142","metadata_source":"pith","pith_arxiv_id":"2106.06142","snapshot_observed_at":"2026-08-12T12:16:16.734455Z","title":"DORO: Distributional and Outlier Robust Optimization","venue":"cs.LG","work_id":"a01eda9f-c261-4967-afe2-c12689136d9c","year":2021},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.615115Z"},"links":{"cited_paper":"/paper/2106.06142","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:e0c2e7ed2a39678b2f12ca4ca8572485066fe3340a2119b75a0cadee4d275991","observation_id":"8500b8c7-4524-488f-aecf-0c407067f575","resolution":{"observed_at":"2026-08-12T11:27:15.309985Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.705646Z","title":"and Haghgoo, Behzad and Chen, Annie S","venue":null,"work_id":"09575e89-4304-4bd5-83d6-dd52ea4fa0d9","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.620342Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:f43499f88c9c2dc6fdb072f49653b48d5253209dd84144eaf6a8af708c916f41","observation_id":"17ebcb4b-0bde-442b-839a-eb79b1d79672","resolution":{"observed_at":"2026-08-12T11:27:15.710880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-12T11:27:14.625334Z","title":"and Finn, Chelsea , month = jul, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.625334Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:de8115748c1257b97dc21a907c3ba426a696c30919964ff3d9dcd81375503eb1","observation_id":"893c57f4-7fcf-481f-8125-1d612ac6cda5","resolution":{"observed_at":"2026-08-12T11:27:14.625334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.630485Z","title":"Evaluating","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.630485Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:00ccabd24d32622f08c034a711a056697ae96cc4e5699f0dbdf7579f40dadf1e","observation_id":"c5b2f6bc-9153-46e8-b5f2-fa4d890b401a","resolution":{"observed_at":"2026-08-12T11:27:14.630485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.635401Z","title":"Enabling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.635401Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:59ceb09b1cc24055051f13d3b9b8ef929393c142178eeca943ec81ffa79384ef","observation_id":"6a11c748-9428-41a6-be10-d3b0609dc4f5","resolution":{"observed_at":"2026-08-12T11:27:14.635401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.640336Z","title":"Measuring","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.640336Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:6f16fe118d7e8ac587f4c4e7992509ed3e60dc10eb71386855d1cb8e5f28390f","observation_id":"70fd02e5-b0f8-4348-a893-5c06c9662ec1","resolution":{"observed_at":"2026-08-12T11:27:14.640336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.645389Z","title":"Advances in Neural Information Processing Systems , author =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.645389Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:3c158d8221ec5cd3d45d0353e8a315e97103a4f9475d78a43ab748ec44647113","observation_id":"435d29ca-81d3-40cf-8d41-72191df3d903","resolution":{"observed_at":"2026-08-12T11:27:14.645389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27710","last_updated":"2026-05-26T21:33:29Z","snapshot_observed_at":"2026-08-09T18:39:09.593570Z","submitted_at":"2026-05-26T21:33:29Z","title":"DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation","version":1},"cited_work":{"arxiv_id":"2605.27710","doi":"10.48550/arxiv.2605.27710","metadata_source":"pith","pith_arxiv_id":"2605.27710","snapshot_observed_at":"2026-08-12T12:16:16.734455Z","title":"DeepSciVerify: Verifying Scientific Claim--Citation Alignment via LLM-Driven Evidence Escalation","venue":"cs.AI","work_id":"3497ae0e-635f-4fb2-b3b8-c953587fe62a","year":2026},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.649731Z"},"links":{"cited_paper":"/paper/2605.27710","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:04486118370cdb952794ff6024ec77b593b05e7372ba7bf4f57be1a4339a307d","observation_id":"6ae0a78c-693f-4c9c-a4ba-6c5ab9043d4e","resolution":{"observed_at":"2026-08-12T11:27:15.239546Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07641","last_updated":"2024-04-16T04:50:08Z","snapshot_observed_at":"2026-08-09T06:10:08.807744Z","submitted_at":"2023-10-11T16:38:11Z","title":"Evaluating Large Language Models at Evaluating Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07641","snapshot_observed_at":"2026-08-12T11:27:14.654832Z","title":"Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.654832Z"},"links":{"cited_paper":"/paper/2310.07641","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:b712d5bec24334c990a524f007faeed87fe901ad00e50b492aa04965e2b98fc4","observation_id":"0786b739-323b-406d-81cf-1a8b92555a4d","resolution":{"observed_at":"2026-08-12T11:27:14.654832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14016","last_updated":"2024-07-04T12:34:44Z","snapshot_observed_at":"2026-08-10T09:52:10.848323Z","submitted_at":"2024-02-21T18:55:20Z","title":"Is LLM-as-a-Judge Robust? Investigating Universal Adversarial Attacks on Zero-shot LLM Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14016","snapshot_observed_at":"2026-08-12T11:27:14.659813Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.659813Z"},"links":{"cited_paper":"/paper/2402.14016","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:dbae475b6c03140b8f7f80a956547a933c605657e68360c77fda246124b8572e","observation_id":"04ce2feb-6030-4475-83fc-3616d40e9a35","resolution":{"observed_at":"2026-08-12T11:27:14.659813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.03064","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.175799Z","title":null,"venue":null,"work_id":"5a270ffc-ff31-4445-b04e-08cdaa75102f","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.664613Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:e3789a9f219a120a4fe7ee3f4b0e7998456379d7e3c841e85d8a97c32440cead","observation_id":"372cb7e0-17b5-4fbf-9a42-f20d3b8c57c3","resolution":{"observed_at":"2026-08-12T11:27:15.181180Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.669429Z","title":"Proceedings of the 63rd","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.669429Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:8c11f259d1db4aeef177e7f9952aed6c08cc6fc81987072233de45457999d2d2","observation_id":"28a4c5a3-e92b-42c4-953e-6024c09ca0c6","resolution":{"observed_at":"2026-08-12T11:27:14.669429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.10807","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:15.095639Z","title":null,"venue":null,"work_id":"184bde95-c32d-480d-ab7e-cd65064fd0e7","year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.675157Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:ce42238365b239db348be151e595e7484cd23171d1c461c0728c9a5929314799","observation_id":"3e170810-b0cb-4fdf-893b-cedca4f5aa9b","resolution":{"observed_at":"2026-08-12T11:27:15.100351Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.12071","last_updated":"2026-06-10T13:34:38Z","snapshot_observed_at":"2026-08-05T23:03:46.905705Z","submitted_at":"2026-06-10T13:34:38Z","title":"On the Limits of LLM-as-Judge for Scientific Novelty Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.12071","snapshot_observed_at":"2026-08-12T11:27:14.679948Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.679948Z"},"links":{"cited_paper":"/paper/2606.12071","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:43a7b1dff2cbb99a9b5ae7f9fbef4684748a996c86fcfec19b4e4917ef1ddc88","observation_id":"a744e5b3-94de-4f9c-abd5-b48e66509e8b","resolution":{"observed_at":"2026-08-12T11:27:14.679948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.1635","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.968163Z","title":"and Goel, Pranav and Stoehr, Niklas and Ash, Elliott and Hoyle, Alexander Miserlis , editor =","venue":null,"work_id":"4ae208fe-68cd-4a0b-853a-974558472565","year":2025},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.684978Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:d20184adbb11450a7963dbc1b6090113f5e796098763ac1829040da76fd6b9c9","observation_id":"25cb44d5-be12-404e-bdc6-331dd3e08d6b","resolution":{"observed_at":"2026-08-12T11:27:14.973197Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06635","last_updated":"2026-05-07T17:46:45Z","snapshot_observed_at":"2026-08-11T13:15:47.528730Z","submitted_at":"2026-05-07T17:46:45Z","title":"Cited but Not Verified: Parsing and Evaluating Source Attribution in LLM Deep Research Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06635","snapshot_observed_at":"2026-08-12T11:27:14.690819Z","title":"Cited but","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.690819Z"},"links":{"cited_paper":"/paper/2605.06635","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:ff7844d9adb84acae769ccf77b38d856fbcb1b635ce122d43f55b3e80105d0f2","observation_id":"c4fff4a4-17d5-4146-894e-98057756c811","resolution":{"observed_at":"2026-08-12T11:27:14.690819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19714","last_updated":"2026-06-18T02:26:05Z","snapshot_observed_at":"2026-08-01T18:27:22.876701Z","submitted_at":"2026-06-18T02:26:05Z","title":"AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing","version":1},"cited_work":{"arxiv_id":"2606.19714","doi":"10.48550/arxiv.2606.19714","metadata_source":"pith","pith_arxiv_id":"2606.19714","snapshot_observed_at":"2026-08-12T12:16:16.734455Z","title":"AURA: Adaptive Uncertainty-aware Refinement for LLM-as-a-Judge Auditing","venue":"stat.ML","work_id":"d4d2085c-d796-442c-852c-03bf95c9e10d","year":2026},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.695950Z"},"links":{"cited_paper":"/paper/2606.19714","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:18a2fe182e2d7ce973a572de452377732b7ff17bf1ea60fd60e5ff934b2d9997","observation_id":"9743ab4e-951d-4903-8156-94fb349244f4","resolution":{"observed_at":"2026-08-12T11:27:14.941244Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29234","last_updated":"2026-05-28T01:50:52Z","snapshot_observed_at":"2026-08-05T20:57:22.760802Z","submitted_at":"2026-05-28T01:50:52Z","title":"Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth","version":1},"cited_work":{"arxiv_id":"2605.29234","doi":"10.48550/arxiv.2605.29234","metadata_source":"pith","pith_arxiv_id":"2605.29234","snapshot_observed_at":"2026-08-12T12:16:16.734455Z","title":"Rethinking Literature Search Evaluation: Deep Research Helps, and Human Citation Lists Are Not a Ground Truth","venue":"cs.AI","work_id":"8e540e0f-a457-4abd-9083-4d40ad2c3faf","year":2026},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.700894Z"},"links":{"cited_paper":"/paper/2605.29234","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:a2990140b053b99c90316d765070564fa9d35b66d4c34a93f1ea16173bd1f8fe","observation_id":"c487bd08-d28b-4bf6-966a-6ce5fbfbb600","resolution":{"observed_at":"2026-08-12T11:27:14.919387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00898","last_updated":"2026-08-08T01:41:16Z","snapshot_observed_at":"2026-08-12T21:12:52.803235Z","submitted_at":"2026-05-30T21:22:47Z","title":"Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law","version":2},"cited_work":{"arxiv_id":"2606.00898","doi":"10.48550/arxiv.2606.00898","metadata_source":"pith","pith_arxiv_id":"2606.00898","snapshot_observed_at":"2026-08-12T12:16:16.734455Z","title":"Citation Grounding Measures the Oracle: Graph Coverage Determines Reported LLM Hallucination Rates in Law","venue":"cs.CL","work_id":"74ce50fc-11e3-410c-a671-a3df395567f6","year":2026},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.705829Z"},"links":{"cited_paper":"/paper/2606.00898","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:c0a0c9adb3eb04b3f6daf2e22486cb925b6ca5e12a7349b3adbeed22639890be","observation_id":"71e4d072-acbd-4332-aee2-764f35a263fd","resolution":{"observed_at":"2026-08-12T11:27:14.897265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11462","last_updated":"2023-08-20T22:08:03Z","snapshot_observed_at":"2026-08-03T20:35:47.668090Z","submitted_at":"2023-08-20T22:08:03Z","title":"LegalBench: A Collaboratively Built Benchmark for Measuring Legal Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11462","snapshot_observed_at":"2026-08-12T11:27:14.710985Z","title":"and Ré, Christopher and Chilton, Adam and Narayana, Aditya and Chohlas-Wood, Alex and Peters, Austin and Waldon, Brandon and Rockmore, Daniel N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.710985Z"},"links":{"cited_paper":"/paper/2308.11462","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:6bfff0bda216f4c426ccf4e49ca2cc3ad7687650f7fbe1fdf2e2086ab9a2e7d4","observation_id":"a5c890be-981e-49d4-b186-c5aec3ffd088","resolution":{"observed_at":"2026-08-12T11:27:14.710985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-acl.721","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:27:14.852387Z","title":"Findings of the","venue":null,"work_id":"c47ce24e-b546-4760-adda-1522517b5a0b","year":2025},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.716472Z"},"links":{"citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:24d5d5d8e5c913333b866e7511e6e5138c8ee3f93d3f0842c35ec1edbc8e889c","observation_id":"6f21bfed-a74f-4d0c-bbe5-4c08ef2704e8","resolution":{"observed_at":"2026-08-12T11:27:14.858172Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04793","last_updated":"2023-11-11T06:51:24Z","snapshot_observed_at":"2026-08-10T18:50:31.354086Z","submitted_at":"2023-10-07T12:52:58Z","title":"FinGPT: Instruction Tuning Benchmark for Open-Source Large Language Models in Financial Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04793","snapshot_observed_at":"2026-08-12T11:27:14.721155Z","title":"doi:10.48550/arXiv.2310.04793 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.721155Z"},"links":{"cited_paper":"/paper/2310.04793","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:1fc34321be69090b16595d2784e2cf79e1a19f2a82daf7dba43eaf582c3076db","observation_id":"b9d8cbf2-89a2-4078-8134-c665b339f574","resolution":{"observed_at":"2026-08-12T11:27:14.721155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11944","last_updated":"2023-11-20T17:28:02Z","snapshot_observed_at":"2026-08-10T08:01:44.134932Z","submitted_at":"2023-11-20T17:28:02Z","title":"FinanceBench: A New Benchmark for Financial Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11944","snapshot_observed_at":"2026-08-12T11:27:14.726217Z","title":"doi:10.48550/arXiv.2311.11944 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.726217Z"},"links":{"cited_paper":"/paper/2311.11944","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:31c3e0c7480c15ba0f7d202ffd741817e045575d1fdae6ab2c2bb9cefa953b9f","observation_id":"3e500578-578c-4cfb-892c-0023d18ce1c8","resolution":{"observed_at":"2026-08-12T11:27:14.726217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09506","last_updated":"2026-06-08T06:05:40Z","snapshot_observed_at":"2026-08-12T06:55:51.971835Z","submitted_at":"2025-12-10T10:30:00Z","title":"Beyond Knowledge to Agency: Evaluating Expertise, Autonomy, and Integrity in Finance with CNFinBench","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.09506","snapshot_observed_at":"2026-08-12T11:27:14.730913Z","title":"doi:10.48550/arXiv.2512.09506 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.730913Z"},"links":{"cited_paper":"/paper/2512.09506","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:9030d3c0c15ceeb1cab38a813709f267312224bd416b14aaa8faa9af75c77816","observation_id":"df4e0999-fe47-4441-a68f-e71cba2bccb3","resolution":{"observed_at":"2026-08-12T11:27:14.730913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03849","last_updated":"2022-10-07T23:48:50Z","snapshot_observed_at":"2026-08-10T22:13:21.070158Z","submitted_at":"2022-10-07T23:48:50Z","title":"ConvFinQA: Exploring the Chain of Numerical Reasoning in Conversational Finance Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03849","snapshot_observed_at":"2026-08-12T11:27:14.735752Z","title":"doi:10.48550/arXiv.2210.03849 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.735752Z"},"links":{"cited_paper":"/paper/2210.03849","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:633711a855d2e04d63aa189d71fe546b8d433685fea06e705703a414253bbb97","observation_id":"788d2f23-0e55-4f54-9dbb-b24f9e08b1af","resolution":{"observed_at":"2026-08-12T11:27:14.735752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-08-11T03:07:17.578573Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-12T11:27:14.740756Z","title":"doi:10.48550/arXiv.2109.00122 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T11:27:14.740756Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2608.11047"},"observation_digest":"sha256:c1b2dc983fcdebc7bd6d4ae47396e09e2a8a0ac1088ab723e4494e96f75fd8ff","observation_id":"1e72da66-2209-4f13-bfee-8d4b5c18002b","resolution":{"observed_at":"2026-08-12T11:27:14.740756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11047","last_updated":"2026-08-11T15:18:47Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T21:22:10.889359Z","submitted_at":"2026-08-11T15:18:47Z","title":"V-FiLLM: Verified Financial LLM Reasoning Benchmark"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":39,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2608.11047."}