{"as_of":"2026-08-09T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8e40088dde7c15e357f11762abded55ad1a8c116a7f89776ffd6f7699a41f2b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:24:25.344894Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:47:25.903971Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T04:48:26.303240Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2406.19314"},"observation_digest":"sha256:431bf3857e3f02edc8880378245ad1937da6c49ec1c9bbb96599678433a2a937","observation_id":"da975d38-1082-4a7f-8cb6-a4ee7715d135","resolution":{"observed_at":"2026-05-15T04:48:26.488804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-15T00:42:11.891829Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2410.05229"},"observation_digest":"sha256:6487e26160d2288c66f14bc8857e4873e1c93dfd4d3623b37a8633fddc44accd","observation_id":"eab653d2-d2a8-4d6f-a349-0f105c367b7c","resolution":{"observed_at":"2026-05-15T00:42:12.049878Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-08T20:24:25.344894Z","title":"B, Anto P V, Shashank Menon, Ajay Sukumar, Adwaith Samod T, Alan Philipose, Stevin Prince, and Sooraj Thomas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05085","last_updated":"2025-02-07T17:01:37Z","snapshot_observed_at":"2026-08-09T10:52:58.246538Z","submitted_at":"2025-02-07T17:01:37Z","title":"Causality can systematically address the monsters under the bench(marks)","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-08-08T20:24:25.344894Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2502.05085"},"observation_digest":"sha256:56327300f914dadef745cf18e15247e32d52269b07eb1f5805e0b7df2ababefe","observation_id":"b0cc88f7-7a2c-4e29-b638-15b9039612f3","resolution":{"observed_at":"2026-08-08T20:24:25.344894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-07T13:05:07.629687Z","title":"Srivastava et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23851","last_updated":"2026-06-17T17:18:26Z","snapshot_observed_at":"2026-08-07T12:54:58.195413Z","submitted_at":"2025-05-28T23:11:14Z","title":"ASyMOB: Algebraic Symbolic Mathematical Operations Benchmark","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:05:07.629687Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2505.23851"},"observation_digest":"sha256:44e7d75ceae6a53aaf139eb401c137667fae328376bbe3eec07c28e684dd125f","observation_id":"f329c6bc-ee4e-4f40-a39c-393130f64d25","resolution":{"observed_at":"2026-08-07T13:05:07.629687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-06T16:58:59.669192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12379","last_updated":"2025-07-16T16:27:50Z","snapshot_observed_at":"2026-08-06T16:44:56.057967Z","submitted_at":"2025-07-16T16:27:50Z","title":"Probing for Arithmetic Errors in Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:58:59.669192Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2507.12379"},"observation_digest":"sha256:ecb4476dc1f3a19974d7c36ac36ac10a38dc1452504798997ddfdca3e75ebf6e","observation_id":"3826905d-f638-4ed1-aa2b-97dc4f193be1","resolution":{"observed_at":"2026-08-06T16:58:59.669192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2509.17677","last_updated":"2026-05-02T16:35:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T12:20:27Z","title":"EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T15:08:03.793304Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2509.17677"},"observation_digest":"sha256:e79d3ffd546079775bfd5ceb4b4c370b2e341f6373bb794c0d93314ab5e3e8e1","observation_id":"fac53161-6d61-45da-b0ef-7080273f2620","resolution":{"observed_at":"2026-05-18T15:11:32.703761Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:c4e6ee20d7a149b044f838c082dba5f0d2f83b74cd161ae3dca97c831ffd98a8","observation_id":"ac9ef06e-0d3a-4efc-a2b4-f1446c679a46","resolution":{"observed_at":"2026-05-11T05:36:00.854306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-09T14:53:17.080982Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T00:06:08.545334Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:3022e28979eb2a4ddce78842ddcb8a9374eeeec686155eb5a3d53824c89e54c6","observation_id":"36339f75-5eda-42d9-a948-c9fb76348a22","resolution":{"observed_at":"2026-05-15T00:08:21.713534Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-09T14:53:17.080982Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T11:18:51.642405Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:fa9b720426162c28f53e13c14f1f7ef1d31883d4b8b51c47b951dcf06802aedb","observation_id":"6374d269-33f9-4537-8891-e3976752897d","resolution":{"observed_at":"2026-05-22T11:21:28.862792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T17:25:30.907575Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08571","last_updated":"2026-07-21T03:29:11Z","snapshot_observed_at":"2026-08-09T14:53:17.080982Z","submitted_at":"2026-03-26T22:19:33Z","title":"Robust Reasoning Benchmark","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T17:25:30.907575Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2604.08571"},"observation_digest":"sha256:ad06d538c242da491bf48ec32734a32cc4fc78376e2f056d0e94b370e8809b22","observation_id":"3e85165a-702b-4235-8e8b-4d0b8e12e8b4","resolution":{"observed_at":"2026-08-02T17:25:30.907575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2605.15393","last_updated":"2026-05-14T20:26:59Z","snapshot_observed_at":"2026-08-08T12:04:09.865268Z","submitted_at":"2026-05-14T20:26:59Z","title":"LPDS: Evaluating LLM Robustness Through Logic-Preserving Difficulty Scaling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-19T16:33:30.850113Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2605.15393"},"observation_digest":"sha256:77ac3fb3385d9d714b0e462cbc7df5c2203d85d847db6246b0e6da15feed5975","observation_id":"e40167f0-3073-4d43-b3d3-dcb104f12179","resolution":{"observed_at":"2026-05-19T16:37:40.203346Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:c1c1f861ad8f1d1e63b5c4aa247546158c73ebf2ef23b1798d1dfc35b8a848ce","observation_id":"730dc534-79cb-4f5f-94b6-fd545a8a024e","resolution":{"observed_at":"2026-07-02T22:47:25.905611Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T12:05:18.483003Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":4},"reference_index":259,"source":"pdf_text","source_observed_at":"2026-08-02T12:05:18.483003Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:e10ff7175151c5bddf1110de42bcd401732b1991b2b5ca650bd6cb5a44316346","observation_id":"9f4da5cd-79e4-435b-9d6a-4608fea40c7b","resolution":{"observed_at":"2026-08-02T12:05:18.483003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":"2402.19450","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-07-02T22:47:25.903971Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap","venue":null,"work_id":"3f036aaf-d7cc-4f5a-bf94-8988f65d9634","year":2024},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-08T10:47:58.204777Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:32.667865Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:b6115f911a1678556863da96bbb04b78decd6ed7a280c6e6cecb197f7764669c","observation_id":"6f402b3a-c51d-487d-ac1b-8d2bd36d255e","resolution":{"observed_at":"2026-06-30T06:44:19.704626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19450","snapshot_observed_at":"2026-08-02T09:35:02.975384Z","title":"Functional benchmarks for robust evaluation of reasoning performance, and the reasoning gap.arXiv preprint arXiv:2402.19450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.30182","last_updated":"2026-07-17T10:56:56Z","snapshot_observed_at":"2026-08-08T10:47:58.204777Z","submitted_at":"2026-06-29T11:57:32Z","title":"MirrorCode: AI can rebuild entire programs from behavior alone","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T09:35:02.975384Z"},"links":{"cited_paper":"/paper/2402.19450","citing_paper":"/paper/2606.30182"},"observation_digest":"sha256:b5a830e96c88bc4184b9aed614eba201e53cf65e497b7bd680a132a144965817","observation_id":"f775b9b4-0b01-49ef-b1c7-7cf72a1db984","resolution":{"observed_at":"2026-08-02T09:35:02.975384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.19450/citation-record","integrity":"/paper/2402.19450/integrity","json":"/paper/2402.19450/citation-record.json","paper":"/paper/2402.19450"},"outbound":[],"paper":{"arxiv_id":"2402.19450","last_updated":"2024-02-29T18:48:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T17:37:39.610989Z","submitted_at":"2024-02-29T18:48:18Z","title":"Functional Benchmarks for Robust Evaluation of Reasoning Performance, and the Reasoning Gap"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2402.19450."}