{"as_of":"2026-08-11T08:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:535c1763aafb3e3c68706c724fc8a0d20c1999cfc621723927250b586d2e1cb2","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:38:37.872964Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:25:49.461260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:16:15.729965Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13833","snapshot_observed_at":"2026-08-08T20:25:49.461260Z","title":"On the reasoning capacity of ai models and how to quantify it","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.05078","last_updated":"2025-02-07T16:54:19Z","snapshot_observed_at":"2026-08-09T10:42:05.397076Z","submitted_at":"2025-02-07T16:54:19Z","title":"Adaptive Graph of Thoughts: Test-Time Adaptive Reasoning Unifying Chain, Tree, and Graph Structures","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T20:25:49.461260Z"},"links":{"cited_paper":"/paper/2501.13833","citing_paper":"/paper/2502.05078"},"observation_digest":"sha256:b418d5c0cb1ab9206d77c5032bddbdc0072892b8a133fa88b4e18e9e698dd1e2","observation_id":"b4909391-9c1b-4176-a1c7-1f02507edeb2","resolution":{"observed_at":"2026-08-08T20:25:49.461260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"cited_work":{"arxiv_id":"2501.13833","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.13833","snapshot_observed_at":"2026-08-06T21:16:15.729965Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","venue":"cs.AI","work_id":"b9a50dfe-ecbc-4108-9724-68aaadd1fc16","year":2025},"citing_paper":{"arxiv_id":"2507.00672","last_updated":"2025-07-01T11:13:56Z","snapshot_observed_at":"2026-08-07T09:02:35.437888Z","submitted_at":"2025-07-01T11:13:56Z","title":"Toward Edge General Intelligence with Multiple-Large Language Model (Multi-LLM): Architecture, Trust, and Orchestration","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:16:14.752438Z"},"links":{"cited_paper":"/paper/2501.13833","citing_paper":"/paper/2507.00672"},"observation_digest":"sha256:beffde153714a4056a20fa58c2a5da43d21f3de22b7a24fe097bee8525ea80f5","observation_id":"d56c56ec-29e2-4287-9919-7b8e9fba6e9e","resolution":{"observed_at":"2026-08-06T21:16:15.733589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13833/citation-record","integrity":"/paper/2501.13833/integrity","json":"/paper/2501.13833/citation-record.json","paper":"/paper/2501.13833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.435022Z","title":"What is 2 + 2?","venue":null,"work_id":"271ab5ca-00ff-42a3-9e74-23b06a151cae","year":null},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.284854Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:c1fad65cf9281720b4bd66bd3192354391a246063658398b02bbdf51d17e1aed","observation_id":"18b02b68-d690-44aa-8dca-f97fb2bc6498","resolution":{"observed_at":"2026-08-10T15:38:38.507502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T15:38:37.332783Z","title":"OpenAI, Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.332783Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:0076cf17f8293aaa438ba7e74af9866987af6be8c30d039c0d844ee10391b8a5","observation_id":"75d634e0-2a6c-4b2f-bd76-1493eb8d6d48","resolution":{"observed_at":"2026-08-10T15:38:37.332783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T15:38:37.414799Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.414799Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:dce472daf69b9b3ae622649894e7c2e0d586e653071799c205d918b1371b19b9","observation_id":"98a16d17-e5dc-4d12-bc2c-9bc902087601","resolution":{"observed_at":"2026-08-10T15:38:37.414799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T15:38:37.459542Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.459542Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:428a3b380b1dd1f35891cdb232cf6a935bb9124b5e6e89b6ad50dcb70b08538e","observation_id":"513e532c-38c8-485f-96c1-1364b0b518d4","resolution":{"observed_at":"2026-08-10T15:38:37.459542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-10T15:38:37.463428Z","title":"Bubeck, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.463428Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:fcc09ef27892c99d67501e6b9d25325a288391f43ffdcd0f49fd1ba12a02d5de","observation_id":"354427ac-4e33-43ab-8364-cc7f12f90ac3","resolution":{"observed_at":"2026-08-10T15:38:37.463428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.425000Z","title":null,"venue":null,"work_id":"bb0f340d-3ed0-4e06-9b52-18df6df914c0","year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.468695Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:c42c00d3b0c7b7ed627e6931ce0e37cdea3d34b8f8d8d5205355751a0e6b77d2","observation_id":"b46fb890-7237-44c7-91b8-01744d9fe674","resolution":{"observed_at":"2026-08-10T15:38:38.428486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-10T15:38:37.472723Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.472723Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:0d0187c349eedc1ddd4e5873d4f2a32e8442a7700da63bbdcdc6304283d92cf1","observation_id":"43305c0a-dd35-4185-95dc-03cb37cd35c9","resolution":{"observed_at":"2026-08-10T15:38:37.472723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-10T15:38:37.476988Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.476988Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:a28220b1291fe5824b280a2a0ff2fcf1e0fce71852dc173a494a66a22923d717","observation_id":"8932eb75-e256-4371-b190-fd38da0bc035","resolution":{"observed_at":"2026-08-10T15:38:37.476988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-10T15:38:37.480762Z","title":"Suzgun, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.480762Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:8b3e97c89df0b1909f12d81f2752b4e2d282a2c4842f1db92cb54efaf904c05a","observation_id":"cae2543c-5c9c-464f-9500-08e524451f5c","resolution":{"observed_at":"2026-08-10T15:38:37.480762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-10T15:38:37.484754Z","title":"Farajtabar, Gsm-symbolic: Understanding the limitations of mathematical reasoning in large lan- guage models, arXiv preprint arXiv:2410.05229 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.484754Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:c63c0bab99ad72287d994bb34b149cff08f56057a6b0a14b953d61fe0e00de59","observation_id":"983bde7a-45fb-4639-b51f-400c5e376f73","resolution":{"observed_at":"2026-08-10T15:38:37.484754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00757","last_updated":"2024-10-08T14:34:37Z","snapshot_observed_at":"2026-08-07T23:34:28.522701Z","submitted_at":"2024-01-01T13:53:53Z","title":"LogicAsker: Evaluating and Improving the Logical Reasoning Ability of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00757","snapshot_observed_at":"2026-08-10T15:38:37.537068Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.537068Z"},"links":{"cited_paper":"/paper/2401.00757","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:db9000d1e85d9cf610eca44eafc46360b99621ce93b6809f15bba70370957f4d","observation_id":"b2c851b4-0bf9-494b-8d79-e9beed6a6559","resolution":{"observed_at":"2026-08-10T15:38:37.537068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02477","last_updated":"2024-03-28T23:37:24Z","snapshot_observed_at":"2026-08-09T20:31:51.939524Z","submitted_at":"2023-07-05T17:50:42Z","title":"Reasoning or Reciting? Exploring the Capabilities and Limitations of Language Models Through Counterfactual Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02477","snapshot_observed_at":"2026-08-10T15:38:37.595403Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.595403Z"},"links":{"cited_paper":"/paper/2307.02477","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:454ffadc906db5a66618663c40c5a968ec3a2ac1912f816a76bfcb5fa37c10f7","observation_id":"6b89c6f0-bb6c-447c-b3b5-122d3201f67e","resolution":{"observed_at":"2026-08-10T15:38:37.595403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.414988Z","title":"Gunning and D","venue":null,"work_id":"48c733d1-a20c-42c9-9969-037b5dca9bbd","year":2019},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.601117Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:91142050916aee159549bb04ad2680454986d86c6fdeb1828a4b84b2783c134c","observation_id":"42f887fb-1f70-4361-ac05-1dd50c780b01","resolution":{"observed_at":"2026-08-10T15:38:38.418432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01769","last_updated":"2024-11-21T23:39:12Z","snapshot_observed_at":"2026-08-06T16:39:54.371324Z","submitted_at":"2024-05-02T22:43:02Z","title":"A Survey on Large Language Models for Critical Societal Domains: Finance, Healthcare, and Law","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01769","snapshot_observed_at":"2026-08-10T15:38:37.605902Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.605902Z"},"links":{"cited_paper":"/paper/2405.01769","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:fbdfecbb4711449f306331e771ca934feec755e5d0463225050f653588c1aa79","observation_id":"0ed7ed4f-24a2-48c7-be32-b196d4031a1b","resolution":{"observed_at":"2026-08-10T15:38:37.605902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12618","last_updated":"2024-10-01T17:50:25Z","snapshot_observed_at":"2026-08-04T13:31:30.342476Z","submitted_at":"2024-09-19T09:44:17Z","title":"Iteration of Thought: Leveraging Inner Dialogue for Autonomous Large Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12618","snapshot_observed_at":"2026-08-10T15:38:37.609456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.609456Z"},"links":{"cited_paper":"/paper/2409.12618","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:d8280444c0d229a74c98361d8e2401eee1237ae00392c6980a9071b4e80e2a8a","observation_id":"ddf6b04f-6eff-4d13-9c35-2754852acac7","resolution":{"observed_at":"2026-08-10T15:38:37.609456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-10T15:38:37.613135Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.613135Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:f416d0bc1cf05bdd65b424f16a6e8e932bdce3de810feeea7f73f35a56a83e14","observation_id":"bc59994b-c18c-456e-a981-c49940276022","resolution":{"observed_at":"2026-08-10T15:38:37.613135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.404662Z","title":"Dziri, X","venue":null,"work_id":"653880b4-ae13-4ad7-8939-ea3906f1dbe3","year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.616593Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:2a5234003c782f316d66b1c621f36aa8bbc5443140cd1fd5fcd9b4fb34abda86","observation_id":"d4b273d7-2585-48fe-ad20-abbf2dab4070","resolution":{"observed_at":"2026-08-10T15:38:38.408271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.07206","last_updated":"2022-05-24T02:08:16Z","snapshot_observed_at":"2026-08-11T03:29:33.675224Z","submitted_at":"2022-02-15T05:43:54Z","title":"Impact of Pretraining Term Frequencies on Few-Shot Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.07206","snapshot_observed_at":"2026-08-10T15:38:37.619568Z","title":"Razeghi, R","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.619568Z"},"links":{"cited_paper":"/paper/2202.07206","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:5b55863a8894ea8ab73727a31de2ad0807338c7cb3999b88e0f7d0c02c6aeab3","observation_id":"0d57b22c-67e0-451c-967b-f12344acc88d","resolution":{"observed_at":"2026-08-10T15:38:37.619568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11050","last_updated":"2024-10-04T04:40:03Z","snapshot_observed_at":"2026-08-10T14:42:57.930773Z","submitted_at":"2024-06-16T19:22:53Z","title":"A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11050","snapshot_observed_at":"2026-08-10T15:38:37.622999Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.622999Z"},"links":{"cited_paper":"/paper/2406.11050","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:390cd9e8efa874b59958057abd6c85d5efa9fc36150ddd8bf366f91b6654708d","observation_id":"6bc718f5-5329-4aa0-98b1-9e0ddfe57208","resolution":{"observed_at":"2026-08-10T15:38:37.622999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19555","last_updated":"2024-01-02T22:30:00Z","snapshot_observed_at":"2026-08-09T06:55:53.522370Z","submitted_at":"2023-05-31T04:50:29Z","title":"Large Language Models Are Not Strong Abstract Reasoners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19555","snapshot_observed_at":"2026-08-10T15:38:37.626155Z","title":"Gendron, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.626155Z"},"links":{"cited_paper":"/paper/2305.19555","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:6e232cdce0876287e08df2671d455ad7016fb8c3b7b122a927dff7c60b6a9b98","observation_id":"56faf873-7670-4ffd-8b00-472bec2df561","resolution":{"observed_at":"2026-08-10T15:38:37.626155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.393242Z","title":"Tovey, S","venue":null,"work_id":"35a9f371-2fb9-40f1-8a35-a0ba3bea8042","year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.665894Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:0bfc5d756495d411908b768e3d32a4bd0d06396d4f99ef68901f15ecd8ce0792","observation_id":"6d25bb6b-82d3-4e84-b865-50c4048afa17","resolution":{"observed_at":"2026-08-10T15:38:38.396766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.382499Z","title":null,"venue":null,"work_id":"f872ec49-8b13-4a7c-8128-5751b4fdab6b","year":2019},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.708647Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:2de7afc6756d977c6c5a11c29145457bb6e3b38bdd5fad756d61afd10a3d7f8c","observation_id":"aa2e6a75-2c8d-46d1-9298-b61079a2c1b4","resolution":{"observed_at":"2026-08-10T15:38:38.386102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.372050Z","title":"Golgoon, K","venue":null,"work_id":"f08de92e-2942-4a5a-bc50-278ec3ecdb29","year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.748868Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:bcf558933779d3a1c6cd76c792c25905bcff69bd097b7bbde7d80dd10a6776dd","observation_id":"4ea314c8-a515-4c9c-90ec-7c8522cfb263","resolution":{"observed_at":"2026-08-10T15:38:38.375826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14082","last_updated":"2024-08-23T23:02:28Z","snapshot_observed_at":"2026-07-06T18:03:38.397804Z","submitted_at":"2024-04-22T11:01:51Z","title":"Mechanistic Interpretability for AI Safety -- A Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14082","snapshot_observed_at":"2026-08-10T15:38:37.752513Z","title":"Bereska and E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.752513Z"},"links":{"cited_paper":"/paper/2404.14082","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:b8824cf53cfe69b93e2fcada6cd878b65bc15652f2f42f73b204de5a5335ac28","observation_id":"42220632-f80c-4327-a83d-fdcd5507a5bb","resolution":{"observed_at":"2026-08-10T15:38:37.752513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.300532Z","title":null,"venue":null,"work_id":"b12fe642-1dd1-40a2-a8a5-adcdcd6dcc8a","year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.756292Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:579d15bb4fcfa182ae63670411bb61c6129f0a78b763c8fe4ed408ce95150a24","observation_id":"7291690f-f046-464a-9a55-98bad866d2be","resolution":{"observed_at":"2026-08-10T15:38:38.322974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.290768Z","title":"Valmeekam, A","venue":null,"work_id":"da528cd2-b2c5-4888-9b52-e81a73633a7e","year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.759551Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:266ad69df410795489934fcda5732244058a1af365943435ddc3aa965ee8cfc2","observation_id":"1ee27578-1ed7-47d5-ba90-6dc722289725","resolution":{"observed_at":"2026-08-10T15:38:38.293993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.07051","last_updated":"2024-07-17T22:01:29Z","snapshot_observed_at":"2026-07-06T13:31:28.340143Z","submitted_at":"2022-07-14T16:51:09Z","title":"Language models show human-like content effects on reasoning tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.07051","snapshot_observed_at":"2026-08-10T15:38:37.765391Z","title":"Dasgupta, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.765391Z"},"links":{"cited_paper":"/paper/2207.07051","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:d924c1db2b68464309b6ecba6c0c7e4909b327e4ad23fbf499f283edd15e313d","observation_id":"5706ed2f-4d7f-4eda-baab-67ad3e776b57","resolution":{"observed_at":"2026-08-10T15:38:37.765391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07328","last_updated":"2017-07-23T18:26:29Z","snapshot_observed_at":"2026-08-10T10:15:48.341478Z","submitted_at":"2017-07-23T18:26:29Z","title":"Adversarial Examples for Evaluating Reading Comprehension Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07328","snapshot_observed_at":"2026-08-10T15:38:37.768340Z","title":"Jia and P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.768340Z"},"links":{"cited_paper":"/paper/1707.07328","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:25e11d7750ae5fc6f84db3ecde09fb07dfda0b44db4d5ea90f13491f8fb6c7c1","observation_id":"a0e80c6b-6779-4cd3-a7eb-81cef4be312f","resolution":{"observed_at":"2026-08-10T15:38:37.768340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.01007","last_updated":"2019-06-24T16:02:01Z","snapshot_observed_at":"2026-07-06T07:30:52.835880Z","submitted_at":"2019-02-04T01:54:19Z","title":"Right for the Wrong Reasons: Diagnosing Syntactic Heuristics in Natural Language Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.01007","snapshot_observed_at":"2026-08-10T15:38:37.771308Z","title":"McCoy, Right for the wrong reasons: Diagnosing syntactic heuristics in natural language inference, arXiv preprint arXiv:1902.01007 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.771308Z"},"links":{"cited_paper":"/paper/1902.01007","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:5cd1b26ed8e372b8c78691ad7b11e18baa4b05ebc8090bb2e38c13837080bf26","observation_id":"db25369a-b7a2-4aaa-a512-16d3903dffe7","resolution":{"observed_at":"2026-08-10T15:38:37.771308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01100","last_updated":"2025-03-31T20:37:34Z","snapshot_observed_at":"2026-08-09T22:41:39.198610Z","submitted_at":"2024-07-01T09:06:57Z","title":"Eliminating Position Bias of Language Models: A Mechanistic Approach","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01100","snapshot_observed_at":"2026-08-10T15:38:37.774258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.774258Z"},"links":{"cited_paper":"/paper/2407.01100","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:3c56d3a534c3e3d9e8234b9187052fdc6e2dad40ebbf87d01fc341fb9de0155f","observation_id":"a02743ca-fccf-4bb8-a1a9-ec4d32f72e99","resolution":{"observed_at":"2026-08-10T15:38:37.774258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11483","last_updated":"2023-08-22T14:54:59Z","snapshot_observed_at":"2026-08-07T01:33:49.598772Z","submitted_at":"2023-08-22T14:54:59Z","title":"Large Language Models Sensitivity to The Order of Options in Multiple-Choice Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11483","snapshot_observed_at":"2026-08-10T15:38:37.777384Z","title":"Pezeshkpour and E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.777384Z"},"links":{"cited_paper":"/paper/2308.11483","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:3cd65b1bf886e93e9bf73c11eb6dddebe79ec3d99b0cdb5e9d250f03959c79d3","observation_id":"7c6d2660-e3f3-4d21-82a4-6ef55fa18e28","resolution":{"observed_at":"2026-08-10T15:38:37.777384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15981","last_updated":"2024-06-23T02:02:52Z","snapshot_observed_at":"2026-08-02T00:07:29.192299Z","submitted_at":"2024-06-23T02:02:52Z","title":"Serial Position Effects of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15981","snapshot_observed_at":"2026-08-10T15:38:37.780577Z","title":"Guo and S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.780577Z"},"links":{"cited_paper":"/paper/2406.15981","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:5916307aff5bb1409fb3b1ddafdd80e6f2f7b2e9e4a5008c6d7857401f03cf26","observation_id":"1f0d8331-cff6-4fd2-ba34-c66df23b51b2","resolution":{"observed_at":"2026-08-10T15:38:37.780577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.280985Z","title":"Zheng, H","venue":null,"work_id":"d7db9511-e43c-437f-a23f-1cfee1a22e2e","year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.827832Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:bdf579e66d0954c878bdcae97257c35a18cf731987aedc13af399c155d3b293d","observation_id":"9e04efbc-6ff2-4f93-8bbd-0cb94eb2fd20","resolution":{"observed_at":"2026-08-10T15:38:38.284412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18857","last_updated":"2025-05-17T04:21:30Z","snapshot_observed_at":"2026-08-10T13:32:24.162488Z","submitted_at":"2024-09-27T15:53:54Z","title":"Mitigating Selection Bias with Node Pruning and Auxiliary Options","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18857","snapshot_observed_at":"2026-08-10T15:38:37.850447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.850447Z"},"links":{"cited_paper":"/paper/2409.18857","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:0bb1eb8a1f593462367e1494a9f599929530393318dcbdc39390f16151ed667a","observation_id":"577b710c-a284-4ab1-ac6b-bea31cb810a3","resolution":{"observed_at":"2026-08-10T15:38:37.850447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02536","last_updated":"2025-05-23T10:01:57Z","snapshot_observed_at":"2026-08-06T08:12:55.523935Z","submitted_at":"2024-06-04T17:55:38Z","title":"Mitigate Position Bias in Large Language Models via Scaling a Single Dimension","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02536","snapshot_observed_at":"2026-08-10T15:38:37.854774Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.854774Z"},"links":{"cited_paper":"/paper/2406.02536","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:259f39ce673530d17d42dec26e15418f1f0af1afd2153c39d7669052a36cf9aa","observation_id":"9c70d1bf-d7a4-4176-944d-2591a85a6a83","resolution":{"observed_at":"2026-08-10T15:38:37.854774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14345","last_updated":"2025-03-21T06:36:33Z","snapshot_observed_at":"2026-08-05T00:49:05.241292Z","submitted_at":"2023-09-03T07:14:49Z","title":"Bias Testing and Mitigation in LLM-based Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14345","snapshot_observed_at":"2026-08-10T15:38:37.858493Z","title":"Huang, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.858493Z"},"links":{"cited_paper":"/paper/2309.14345","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:7ce4ba4a366c1c0bee1be2025f1b7e92fcd8f505277d188739ba1ea41595dc30","observation_id":"4e077d67-0ba1-4881-b134-97b2b1c344c0","resolution":{"observed_at":"2026-08-10T15:38:37.858493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.270315Z","title":"Blumenfeld, D","venue":null,"work_id":"15ff49ea-dbd7-4d22-9907-28b6b471cc95","year":2019},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.862166Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:2db1be7baa57a5569a6e52f1b2afaad9cc453025810ef491b0e7c9d97c32bcb3","observation_id":"5b5ddad0-4cd5-4dbd-8e3b-606d3fa12c0d","resolution":{"observed_at":"2026-08-10T15:38:38.273982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06509","last_updated":"2021-01-16T19:44:27Z","snapshot_observed_at":"2026-08-09T10:57:21.491234Z","submitted_at":"2021-01-16T19:44:27Z","title":"Phases of learning dynamics in artificial neural networks: with or without mislabeled data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06509","snapshot_observed_at":"2026-08-10T15:38:37.865514Z","title":"Feng and Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.865514Z"},"links":{"cited_paper":"/paper/2101.06509","citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:aa1c04f3acec7b0368d3e06056e2a7ef32c12b6434160138e84347135a76f440","observation_id":"cefb9ad8-7810-4a7e-b7ed-ea630a660049","resolution":{"observed_at":"2026-08-10T15:38:37.865514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.252609Z","title":null,"venue":null,"work_id":"f9b430b5-e7d7-419c-b1ae-46d218e02994","year":2021},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.869676Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:92c24af525240cd66492af4c87abca7a0f01b32c091ebaeb309ce99ef1c59664","observation_id":"cc1535f2-7703-46cb-a5a2-5dff3a87df94","resolution":{"observed_at":"2026-08-10T15:38:38.261924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:38:38.173315Z","title":"In our case, the questions predominantly involve queries that are heavily reliant onreasoning","venue":null,"work_id":"305185d9-0bc1-4e13-ba92-0925f832b191","year":null},"citing_paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:38:37.872964Z"},"links":{"citing_paper":"/paper/2501.13833"},"observation_digest":"sha256:1281effa5356c11895afe2c95fbee2354e0f693ec33ad4522486882c22972e18","observation_id":"df02b9e4-44c2-44b1-9aac-d091697c99a4","resolution":{"observed_at":"2026-08-10T15:38:38.190771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13833","last_updated":"2025-01-23T16:58:18Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T03:31:48.764883Z","submitted_at":"2025-01-23T16:58:18Z","title":"On the Reasoning Capacity of AI Models and How to Quantify It"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 2 inbound Pith citation observations for arXiv:2501.13833."}