{"as_of":"2026-08-20T13:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b271506cf609bd7bd9aa1f502285745205d773e9e7ad307a825246fb1aeaf5fd","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:14:48.950737Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:43.292037Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-07T12:35:43.292037Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24863","last_updated":"2025-05-30T17:58:36Z","snapshot_observed_at":"2026-08-20T12:36:21.991307Z","submitted_at":"2025-05-30T17:58:36Z","title":"AlphaOne: Reasoning Models Thinking Slow and Fast at Test Time","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:43.292037Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2505.24863"},"observation_digest":"sha256:5ff1fa53678c96b16b66e1ff495a136188b380e445d2d46469adbd39cb415269","observation_id":"61691de3-89af-489a-b581-36ef3b0a6fab","resolution":{"observed_at":"2026-08-07T12:35:43.292037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-07T05:49:38.203391Z","title":"Thoughtterminator: Benchmarking, calibrating, and mitigating overthinking in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-17T09:26:33.416295Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.203391Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:fdeeb892e793678fa5f72e1822dfe57a65dd381d888906afeb5510c588e036bd","observation_id":"30c26e1a-4e14-4d49-b0b5-ba9f08e06c7d","resolution":{"observed_at":"2026-08-07T05:49:38.203391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":"2504.13367","doi":"10.48550/arxiv.2504.13367","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"arXiv (Cornell University)","work_id":"0170e772-1a0d-4c60-b6c0-fcfc4561b6ee","year":2025},"citing_paper":{"arxiv_id":"2507.04023","last_updated":"2026-04-23T08:06:48Z","snapshot_observed_at":"2026-08-16T20:17:28.318210Z","submitted_at":"2025-07-05T12:31:17Z","title":"Do LLMs Overthink Basic Math Reasoning? Benchmarking the Accuracy-Efficiency Tradeoff in Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-19T06:25:12.799097Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2507.04023"},"observation_digest":"sha256:07cc53cbefa65dced5cc1a2a9f4ee534a54d925af6df4d51a31666c76a674cac","observation_id":"965ee1d5-4697-42e8-951f-79d218f4d34c","resolution":{"observed_at":"2026-05-19T06:27:07.339264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-05T17:04:38.732463Z","title":"Thoughtterminator: Benchmarking, calibrating, and mitigating overthinking in reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-17T15:45:29.274413Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T17:04:38.732463Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2508.17196"},"observation_digest":"sha256:ecb309de13fe7eda4dda89ca5c5a2de5159b83cd88a222810274eb7aa54eb463","observation_id":"7efa6940-8689-4eaa-abf6-800d893ff98e","resolution":{"observed_at":"2026-08-05T17:04:38.732463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":"2504.13367","doi":"10.48550/arxiv.2504.13367","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRR , volume =","venue":"arXiv (Cornell University)","work_id":"0170e772-1a0d-4c60-b6c0-fcfc4561b6ee","year":2025},"citing_paper":{"arxiv_id":"2606.17890","last_updated":"2026-06-16T13:10:30Z","snapshot_observed_at":"2026-08-12T14:46:48.192265Z","submitted_at":"2026-06-16T13:10:30Z","title":"Dynamic Rollout Editing for Reducing Overthinking in RL-Trained Reasoning Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T01:19:55.164835Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2606.17890"},"observation_digest":"sha256:e0c3eb8cdfb757f3c570ef0574567e329381e5021845ee81c0b55eda3066c579","observation_id":"14627de6-5ed9-4683-92de-60bac275179f","resolution":{"observed_at":"2026-06-27T01:20:20.464479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.13367/citation-record","integrity":"/paper/2504.13367/integrity","json":"/paper/2504.13367/citation-record.json","paper":"/paper/2504.13367"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.696075Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.696075Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:a50dc7077d9325b6bd14e81ee8e13e3305c417be6a3dc86dce71a01113bbbbc4","observation_id":"43c2f155-1b99-4149-bfaa-030f7a739ab3","resolution":{"observed_at":"2026-08-16T12:14:48.696075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-20T11:42:35.796814Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-16T12:14:48.702938Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.702938Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:96533a48b59213980475506fca662a1e0af30f4861929593a41ce846740d508f","observation_id":"d4dc3494-2e7f-460b-89c0-2fc42f74b2ae","resolution":{"observed_at":"2026-08-16T12:14:48.702938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:49.660968Z","title":"Over-reasoning and redundant calculation of large language models","venue":null,"work_id":"1c137723-5319-4fd2-ac6d-826754680393","year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.708938Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:5789909d1307941d760fd54d9c45f0b3c0efdb8d3d1d57233c0c6ab5d38f32b3","observation_id":"131b31e2-6268-414d-a5fa-76286ca826cb","resolution":{"observed_at":"2026-08-16T12:14:49.666718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T12:14:48.728995Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.728995Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:f1f04383a1decc675b1a113a1f7985aedd914f6cd31c58225adfead47b6f5442","observation_id":"8e826a7d-29de-4795-90b3-c6956d153280","resolution":{"observed_at":"2026-08-16T12:14:48.728995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T12:14:48.765172Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.765172Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:dbcf599fb0874f8f51126ce7fadab3a0d0b276e2709633e860698bb9c4a6dba6","observation_id":"40b657e6-77ab-432e-bf09-ce7f7a9b9f7f","resolution":{"observed_at":"2026-08-16T12:14:48.765172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14838","last_updated":"2024-05-23T17:54:14Z","snapshot_observed_at":"2026-07-06T18:18:51.814306Z","submitted_at":"2024-05-23T17:54:14Z","title":"From Explicit CoT to Implicit CoT: Learning to Internalize CoT Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14838","snapshot_observed_at":"2026-08-16T12:14:48.806467Z","title":"From explicit cot to implicit cot: Learning to internalize cot step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.806467Z"},"links":{"cited_paper":"/paper/2405.14838","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:d7c6309ce950a15196b76ebe8443c544a483a91666e901a60daf9dc752bcec16","observation_id":"89397f45-798e-4cc4-b659-dea66024f808","resolution":{"observed_at":"2026-08-16T12:14:48.806467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:49.644794Z","title":"Mercury: A code efficiency benchmark for code large language models","venue":null,"work_id":"5661e0e2-f3f4-4e63-af88-af3c01fdc51d","year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.819812Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:d3f218a70bbddcb79a5a509373110807b68c537913ce7a0100cfb49abb54c053","observation_id":"8138f147-c3ab-43d0-b091-4447a71f61e3","resolution":{"observed_at":"2026-08-16T12:14:49.649927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:14:48.825269Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.825269Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:4e6fd000b54386aaf60be455c6803c0f86262924670f30fcd2468c8eaf599585","observation_id":"ebc2cf72-08f3-4931-b578-8a19db43dc35","resolution":{"observed_at":"2026-08-16T12:14:48.825269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20993","last_updated":"2025-05-27T16:41:53Z","snapshot_observed_at":"2026-08-12T17:14:32.746931Z","submitted_at":"2024-12-30T14:57:53Z","title":"Efficiently Scaling LLM Reasoning with Certaindex","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20993","snapshot_observed_at":"2026-08-16T12:14:48.831035Z","title":"Efficiently serving llm reasoning programs with certaindex","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.831035Z"},"links":{"cited_paper":"/paper/2412.20993","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:c76e108be0a2c4a62d2778759a6c388bdb639f09dba68152a3be57e74f585e00","observation_id":"890f2dd9-ab3c-4901-85ab-af273b6b27af","resolution":{"observed_at":"2026-08-16T12:14:48.831035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.836274Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.836274Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:c149a9d64416a53082a16affc48c3d7b988c510a0396c30fc555a15287ea81ef","observation_id":"14891e74-26e4-459a-90ac-3eb649d0eb48","resolution":{"observed_at":"2026-08-16T12:14:48.836274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-16T12:14:48.841825Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.841825Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:f0153818e0ac01ee5c4e37dfa6a1bd8ed701ac4015bb8fbd0d2a6459b40fcc0f","observation_id":"a9687924-55a1-4f17-88e8-0144c8d3e4a6","resolution":{"observed_at":"2026-08-16T12:14:48.841825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-15T13:46:19.286791Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-16T12:14:48.847707Z","title":"Encouraging divergent thinking in large language models through multi-agent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.847707Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:b0a96ccd2c045ab02aebb00610059937c8b85277d97a521bfb70173c2731d992","observation_id":"9ea386ff-7360-4b18-b448-7968903ce8cb","resolution":{"observed_at":"2026-08-16T12:14:48.847707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-17T09:42:34.746112Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-16T12:14:48.853345Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.853345Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:b876217dc89814d823e12ba7d90acfbe557a3f3f5680731381678514a06182e4","observation_id":"08a3d596-66ee-4b56-83f2-0580513257f2","resolution":{"observed_at":"2026-08-16T12:14:48.853345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:49.617467Z","title":"Zebralogic: Benchmarking the logical reasoning ability of language models, 2024","venue":null,"work_id":"2b3b82c8-6654-42db-866b-a2ceed773bd0","year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.858819Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:ef3b4c067e0c089a31b53d116fd0c7e2bec35377508853efaef79e0dac82ede3","observation_id":"18416b25-db0e-4c2a-846a-818b13c5e27d","resolution":{"observed_at":"2026-08-16T12:14:49.622475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01855","last_updated":"2024-11-04T07:10:24Z","snapshot_observed_at":"2026-08-16T13:03:17.765860Z","submitted_at":"2024-11-04T07:10:24Z","title":"Can Language Models Learn to Skip Steps?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01855","snapshot_observed_at":"2026-08-16T12:14:48.864121Z","title":"Can language models learn to skip steps? arXiv preprint arXiv:2411.01855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.864121Z"},"links":{"cited_paper":"/paper/2411.01855","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:c2650add19d406c4584343582e2e53b35b1e55b9a67ba126dea473872ccc8275","observation_id":"b0895ca6-2b2a-4fea-99eb-56b6826f249b","resolution":{"observed_at":"2026-08-16T12:14:48.864121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-16T12:14:48.869627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.869627Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:2c5f13a7aa03b2c16841489c1ec188fb0068c616fb550c8ee42b81100eb6c97a","observation_id":"18ef791c-9136-41eb-bb59-eeeaf2c62948","resolution":{"observed_at":"2026-08-16T12:14:48.869627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-16T12:14:48.875230Z","title":"Zettlemoyer, Percy Liang, Emmanuel J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.875230Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:17756a1dfea42b53a5f63b6c8fd07d9533451185d8026fe3aa7c84a57ea50f8b","observation_id":"05040b97-1084-40e0-9fa5-d14a24de9d5d","resolution":{"observed_at":"2026-08-16T12:14:48.875230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:49.600872Z","title":"Automatically correcting large language models: Surveying the landscape of diverse automated correction strategies","venue":null,"work_id":"5135c48c-c9bf-40e7-aad8-1a302da0550c","year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.880594Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:e15dbf6d5f862e51083eb3a19c67b86ade36cf95bd37ae9ce0e4aba9f33c43fb","observation_id":"8da46fcd-b93a-47b4-bc08-1c3ed408f3ac","resolution":{"observed_at":"2026-08-16T12:14:49.606259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.886922Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.886922Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:175442d1d892601e8b8c19e3a560fcdbadeaec47e846668074a60f64479d9040","observation_id":"09fe61dd-0ab5-4525-816d-8cbe1ee31d2f","resolution":{"observed_at":"2026-08-16T12:14:48.886922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-16T12:14:48.891900Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.891900Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:28e4c08224605734bd82ac7a6a97f898bbbf6ecc7d334e9fa0f99427524ef1d3","observation_id":"f16e2643-33ed-428c-9448-276d20d50424","resolution":{"observed_at":"2026-08-16T12:14:48.891900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-19T12:27:53.107321Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-16T12:14:48.897470Z","title":"To cot or not to cot? chain-of-thought helps mainly on math and symbolic reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.897470Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:462feeaa0019968c1de6baac41e13658346b2af6e675fb0267a79bacc359ee41","observation_id":"e839c21f-89ab-424d-abcb-1bda4628b216","resolution":{"observed_at":"2026-08-16T12:14:48.897470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-16T12:14:48.903190Z","title":"Brown, Adam Santoro, Aditya Gupta, Adri \\`a Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.903190Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:8bc5ceff86ee0bf47163511c3c6479d0cce9cf45fb1537fbca11246293057642","observation_id":"558dea1c-e9b8-4584-8e69-fd9aac865849","resolution":{"observed_at":"2026-08-16T12:14:48.903190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-08-13T07:04:41.220509Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-16T12:14:48.908634Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.908634Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:9d86ddbe5eea857fa3c6de3fb95ac8cba6e7ff495a0a3763c33660c882501156","observation_id":"ac3de784-0977-4b60-8761-e7545f859678","resolution":{"observed_at":"2026-08-16T12:14:48.908634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:49.568421Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":"38d35880-cf15-4e32-afc3-97ec7b0a96b8","year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.913689Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:2bbfa37665a43f3ddc72abab9fef742927c5e6b577c3dffc544a4874f9c8751f","observation_id":"ba55d97d-57b5-48b0-b4ac-e7e288568540","resolution":{"observed_at":"2026-08-16T12:14:49.577326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-16T12:14:48.919605Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.919605Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:3c8d9667c88e62c27ab159d28f7a28d8896dfeb1d436784c1be8653fbd0756c9","observation_id":"bb2eac34-96ff-4878-8cbb-57175fa68ac2","resolution":{"observed_at":"2026-08-16T12:14:48.919605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.925257Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.925257Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:2d7adf3f7aa9a9b885400ef9b2fe4e739181a70e116bbe1ee84c32c99cec7392","observation_id":"0f3c8050-3965-40e9-931c-3b6c50b10716","resolution":{"observed_at":"2026-08-16T12:14:48.925257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17974","last_updated":"2025-01-31T16:06:26Z","snapshot_observed_at":"2026-08-18T10:19:50.807399Z","submitted_at":"2025-01-29T20:20:48Z","title":"Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17974","snapshot_observed_at":"2026-08-16T12:14:48.930518Z","title":"Think smarter not harder: Adaptive reasoning with inference aware optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.930518Z"},"links":{"cited_paper":"/paper/2501.17974","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:7d867ecd02961f9d4559d4092d6bb690eb113dcb237f8d24806e47615be9933b","observation_id":"9f6f807f-5a06-4f50-a79f-b2d089b54981","resolution":{"observed_at":"2026-08-16T12:14:48.930518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-16T14:56:32.958443Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-16T12:14:48.935323Z","title":"Dyval: Dynamic evaluation of large language models for reasoning tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.935323Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:18f2ea0057970246e51ccdf68f97c4a71f7234aaf2abfa339ea0033eb514ddcf","observation_id":"1cdeee7e-923d-4e0c-a08e-82d9643bf942","resolution":{"observed_at":"2026-08-16T12:14:48.935323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.940185Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.940185Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:96c2792c2a2f305f94ced003bb01d83164494e0b1a73bbb9deffacc227e4ca35","observation_id":"52afbd10-403f-48a1-ae6b-0685b53e8fc9","resolution":{"observed_at":"2026-08-16T12:14:48.940185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.945251Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.945251Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:7c7333b900749009745dd12f4f8c5545521eb4b5f1aef40c9d69fa9f47bfb103","observation_id":"40f9b3f5-fa2a-4150-b323-baef6c1e8ba7","resolution":{"observed_at":"2026-08-16T12:14:48.945251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:14:48.950737Z","title":"JH cBP ]D aW Z *+b tW77wϙ 9w;Ri @ O","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T12:14:48.950737Z"},"links":{"citing_paper":"/paper/2504.13367"},"observation_digest":"sha256:bb265f898e557af39b9d714b1bbdd3549ee2d053541ff32ca7ca4fc64b52222f","observation_id":"ddfa9544-8400-4079-bfc6-3dddd38848c9","resolution":{"observed_at":"2026-08-16T12:14:48.950737Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T19:01:41.228842Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 5 inbound Pith citation observations for arXiv:2504.13367."}