{"as_of":"2026-08-11T01:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bb22ab4342e1d09baef92df5aac36947963b01cfd079f2d681749f872347431","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:49:40.577890Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:53:48.051608Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:22:55.270834Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07104","snapshot_observed_at":"2026-08-06T17:53:48.051608Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-10T21:22:23.649310Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:48.051608Z"},"links":{"cited_paper":"/paper/2506.07104","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:6dfb6d798113a4345ffbc4af8dec8579a1a2cdd4b6215ce709f8be639884b31c","observation_id":"c1c4647e-b274-4e3b-8244-f619c76f0c3b","resolution":{"observed_at":"2026-08-06T17:53:48.051608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"cited_work":{"arxiv_id":"2506.07104","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07104","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amirhosein Ghasemabadi, Keith G","venue":null,"work_id":"fd7a60fe-295f-400d-bc97-4dbdb5fd29a6","year":2025},"citing_paper":{"arxiv_id":"2601.11340","last_updated":"2026-04-15T07:21:40Z","snapshot_observed_at":"2026-08-02T05:43:35.759183Z","submitted_at":"2026-01-16T14:38:18Z","title":"Neural Chain-of-Thought Search: Searching the Optimal Reasoning Path to Enhance Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:21:36.606855Z"},"links":{"cited_paper":"/paper/2506.07104","citing_paper":"/paper/2601.11340"},"observation_digest":"sha256:39920f70ba8f2657218cadd2ba9482a20dadcb7e2744e6cc8460afff1bccaafc","observation_id":"8549c248-218b-49cd-b042-681bf3ad756c","resolution":{"observed_at":"2026-05-16T13:22:55.272653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07104/citation-record","integrity":"/paper/2506.07104/integrity","json":"/paper/2506.07104/citation-record.json","paper":"/paper/2506.07104"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T05:49:34.499159Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:34.499159Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:ce877bf44edccd85a0779d4159b3c049f728822bade8c614a244f0f806e8f63f","observation_id":"dcf89b3e-d763-4ed3-af92-b11c20922e51","resolution":{"observed_at":"2026-08-07T05:49:34.499159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:34.596778Z","title":"Training language models to reason efficiently.arXiv preprint arXiv:2502.04463, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:34.596778Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:b7e3df0e17f74794dd855844356952c002ad5a05769408bfa7c74b5fa5abaa5b","observation_id":"8db244d9-d272-41db-af6f-7ea1ce392dfc","resolution":{"observed_at":"2026-08-07T05:49:34.596778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-07T05:49:34.696226Z","title":"Huatuogpt-o1, towards medical complex reasoning with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:34.696226Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:381d99f18e7a4c3e20e1d4d3a43c95f237411816c083adc51ac0279af3292e8d","observation_id":"6938d49c-3201-49b0-89f0-480e540e7bec","resolution":{"observed_at":"2026-08-07T05:49:34.696226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T05:49:35.028025Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.028025Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:a1f8ba9262f2fefbae030772cb8f29ce22803adc0860b23d2c9ffe2328f35652","observation_id":"9769068b-d3e3-4743-a4f4-d51336ab5248","resolution":{"observed_at":"2026-08-07T05:49:35.028025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-08T22:27:57.440955Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-07T05:49:35.129268Z","title":"Thinkless: Llm learns when to think, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.129268Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:da932489cfd7dde2c0805bea54b6785038dbd7e8c72c702c9e12a767509e4364","observation_id":"24297eed-6dbe-462b-9d27-58e0c3675a5e","resolution":{"observed_at":"2026-08-07T05:49:35.129268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20993","last_updated":"2025-05-27T16:41:53Z","snapshot_observed_at":"2026-08-10T23:02:44.976934Z","submitted_at":"2024-12-30T14:57:53Z","title":"Efficiently Scaling LLM Reasoning with Certaindex","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20993","snapshot_observed_at":"2026-08-07T05:49:35.259278Z","title":"Efficiently serving llm reasoning programs with certaindex.arXiv preprint arXiv:2412.20993, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.259278Z"},"links":{"cited_paper":"/paper/2412.20993","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:46d48ff2c24da1486a718d05ccbe75964c2653f5184e0f39bb1bc82e47bf8f19","observation_id":"e92c41ce-5ba5-40f2-a2e8-addd6482a401","resolution":{"observed_at":"2026-08-07T05:49:35.259278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:35.358710Z","title":"Reasoning without self-doubt: More efficient chain-of-thought through certainty probing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.358710Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:28f37e86bf3d2d9fd001eb54801bd1c2ceac92e7cecb06e0e4e81bd07b47abee","observation_id":"e3fa284a-d61b-4d75-a819-64c533390610","resolution":{"observed_at":"2026-08-07T05:49:35.358710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:49:35.468940Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.468940Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:995c5c3d498105c7cd75217e900690fade2c7b22b92f77ad7e5f65ea2c25f488","observation_id":"c1ffa9ca-0a8a-4e7c-9c76-86b37ecdcb0b","resolution":{"observed_at":"2026-08-07T05:49:35.468940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-07T19:18:10.858896Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-07T05:49:35.589682Z","title":"Token-budget-aware llm reasoning.arXiv preprint arXiv:2412.18547, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.589682Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:799a44f74e24736293ab0f235eb92a6704a57337fe65128d9856f3e951415f8b","observation_id":"640a7e38-dd98-47ee-bef0-a35c7b92c105","resolution":{"observed_at":"2026-08-07T05:49:35.589682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:42.311402Z","title":"Skywork open reasoner series","venue":null,"work_id":"67334271-d999-431b-a771-401cfd5934fd","year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.713968Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:61e78a02928100c611c35628aee88a65f71dd9c5868003355eb652d2eeed0ee1","observation_id":"9e3c7f12-3266-4a4c-a2fd-a26d3488b72c","resolution":{"observed_at":"2026-08-07T05:49:42.383342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T05:49:35.815835Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning.arXiv preprint arXiv:2504.01296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.815835Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:b3798a051bbabcfc9e42269496233bc8b384992b6a46751dcf4d743ea69035c1","observation_id":"549e5200-69e8-4e89-9a22-a52ccaa7d237","resolution":{"observed_at":"2026-08-07T05:49:35.815835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T05:49:35.897085Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:35.897085Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:c8028434b719c72cb2f8126d73f3fd0fafccc5a7dceadf2501f3484fb8db7c70","observation_id":"acdd038c-6254-4ca2-82e8-ba764b5ad559","resolution":{"observed_at":"2026-08-07T05:49:35.897085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00031","last_updated":"2025-02-25T00:21:14Z","snapshot_observed_at":"2026-08-10T01:27:28.903517Z","submitted_at":"2025-02-25T00:21:14Z","title":"Efficient Test-Time Scaling via Self-Calibration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00031","snapshot_observed_at":"2026-08-07T05:49:36.050461Z","title":"Efficient test-time scaling via self-calibration.arXiv preprint arXiv:2503.00031, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.050461Z"},"links":{"cited_paper":"/paper/2503.00031","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:06094873ee1e142230e1051fc6ddc04c6a3c4af954d4562302e7d5b7e84a73da","observation_id":"96c1265e-c539-45b8-b150-55341afd6eac","resolution":{"observed_at":"2026-08-07T05:49:36.050461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14631","last_updated":"2025-05-21T05:17:34Z","snapshot_observed_at":"2026-08-10T02:03:47.948620Z","submitted_at":"2025-05-20T17:23:25Z","title":"Think Only When You Need with Large Hybrid-Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14631","snapshot_observed_at":"2026-08-07T05:49:36.120187Z","title":"Think only when you need with large hybrid-reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.120187Z"},"links":{"cited_paper":"/paper/2505.14631","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:07bef613ff57239ef92c5a33ce2280331ff5f514241feb2e0acd12657627029c","observation_id":"7b95b0bf-bfc5-4c36-a823-b52e471b94d0","resolution":{"observed_at":"2026-08-07T05:49:36.120187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11664","last_updated":"2024-12-16T11:12:45Z","snapshot_observed_at":"2026-08-10T20:56:10.210182Z","submitted_at":"2024-12-16T11:12:45Z","title":"C3oT: Generating Shorter Chain-of-Thought without Compromising Effectiveness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11664","snapshot_observed_at":"2026-08-07T05:49:36.187134Z","title":"C3ot: Generating shorter chain-of- thought without compromising effectiveness.arXiv preprint arXiv:2412.11664, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.187134Z"},"links":{"cited_paper":"/paper/2412.11664","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:fc830a9721952f7e843fc1c832022fa94d2b84454a43256648aabd3e56fee3b5","observation_id":"31a2eb7d-20eb-4a0d-a9e9-925851659732","resolution":{"observed_at":"2026-08-07T05:49:36.187134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-07T05:49:36.305178Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.305178Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:11c3b5f8adad6fe30617ccd862df88d29896d5280a552ddf36b6cea0dea44ccb","observation_id":"d09a825c-5489-4883-9108-1d19d919c400","resolution":{"observed_at":"2026-08-07T05:49:36.305178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T05:49:36.467346Z","title":"Limr: Less is more for rl scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.467346Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:4f790a2ec25f2ca8021a365d43e2f4ea8d88e42ba95670458f42e515615e2895","observation_id":"86b8cbe4-6afc-4a59-89fe-b898730394fb","resolution":{"observed_at":"2026-08-07T05:49:36.467346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14183","last_updated":"2025-05-20T10:40:41Z","snapshot_observed_at":"2026-08-08T22:58:06.185935Z","submitted_at":"2025-05-20T10:40:41Z","title":"ThinkSwitcher: When to Think Hard, When to Think Fast","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14183","snapshot_observed_at":"2026-08-07T05:49:36.597126Z","title":"Thinkswitcher: When to think hard, when to think fast, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.597126Z"},"links":{"cited_paper":"/paper/2505.14183","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:92ae4c6f3f64134c1984acd4c7adc90e09ffb81ba36f24276027aba25af6c0d8","observation_id":"2be6c0ee-0ca8-4e3e-abbc-00a4b245e895","resolution":{"observed_at":"2026-08-07T05:49:36.597126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19324","last_updated":"2025-06-26T03:14:46Z","snapshot_observed_at":"2026-08-10T13:46:16.822794Z","submitted_at":"2025-01-31T17:19:57Z","title":"Reward-Guided Speculative Decoding for Efficient LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19324","snapshot_observed_at":"2026-08-07T05:49:36.717578Z","title":"Reward-guided speculative decoding for efficient llm reasoning.arXiv preprint arXiv:2501.19324, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.717578Z"},"links":{"cited_paper":"/paper/2501.19324","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:525d786bcd4ab153c63b608cace61f7dbf940b3a2bb572d0d315d01e5b59a83c","observation_id":"1a1662d7-9fd7-4836-a74c-7d216dbed935","resolution":{"observed_at":"2026-08-07T05:49:36.717578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01855","last_updated":"2024-11-04T07:10:24Z","snapshot_observed_at":"2026-08-01T16:42:29.985049Z","submitted_at":"2024-11-04T07:10:24Z","title":"Can Language Models Learn to Skip Steps?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01855","snapshot_observed_at":"2026-08-07T05:49:36.874631Z","title":"Can language models learn to skip steps?arXiv preprint arXiv:2411.01855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.874631Z"},"links":{"cited_paper":"/paper/2411.01855","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:9cee2a8f97ae2d70de704ee5e402b409875dc40b02a06510535cc055d6d1186b","observation_id":"29cdb302-a971-4b8b-8d35-b197d55327d9","resolution":{"observed_at":"2026-08-07T05:49:36.874631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:36.987668Z","title":"Fin-r1: A large language model for financial reasoning through reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.987668Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:e209269bd9606ed06849e43e4ca8a2731cea7a1efa9e4e941c8157dece6b81f1","observation_id":"602394ee-2587-4421-b319-6b919e1f567d","resolution":{"observed_at":"2026-08-07T05:49:36.987668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-07T05:49:37.109195Z","title":"Adacot: Pareto-optimal adaptive chain-of-thought triggering via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.109195Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:98e92ee0a8ed0e96756b0a009910deb4a5d0c7b7a2021c63893da9d6e783b2f7","observation_id":"58910aff-413b-4669-83d8-436907fc1c4c","resolution":{"observed_at":"2026-08-07T05:49:37.109195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T05:49:37.215102Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning.arXiv preprint arXiv:2501.12570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.215102Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:11a63f1d93e81da77efd9c8d6e642bb0a6037356afaa147a7d263003fbaa74cc","observation_id":"1ebbfb26-892d-4476-a44f-5c1083f4cc91","resolution":{"observed_at":"2026-08-07T05:49:37.215102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:42.133500Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level","venue":null,"work_id":"766fbadb-c0d8-4f8b-8425-e94c6748b71f","year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.308823Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:d127e796c0eae6a9e28f3564b143522476caabf0a9ff86c781f53f3590ffddd8","observation_id":"b0453166-e802-4e6b-93b9-798552d70296","resolution":{"observed_at":"2026-08-07T05:49:42.236363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:37.401902Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.401902Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:84162d199ca96382cf8413c8a2edb2c543a956f2a6040b3de94343fbea404536","observation_id":"c377da9b-340c-492d-9b00-f5ca907016bb","resolution":{"observed_at":"2026-08-07T05:49:37.401902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09601","last_updated":"2025-02-13T18:52:36Z","snapshot_observed_at":"2026-08-08T03:37:50.177168Z","submitted_at":"2025-02-13T18:52:36Z","title":"CoT-Valve: Length-Compressible Chain-of-Thought Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09601","snapshot_observed_at":"2026-08-07T05:49:37.540313Z","title":"Cot-valve: Length-compressible chain-of-thought tuning.arXiv preprint arXiv:2502.09601, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.540313Z"},"links":{"cited_paper":"/paper/2502.09601","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:18bfe8a961ef5cc9d72f7b8d55ec92fad98def2503ec7833e7b8609996e7d7c9","observation_id":"4597f838-16df-4b7d-875d-2b572aa48740","resolution":{"observed_at":"2026-08-07T05:49:37.540313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:37.684760Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.684760Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:9c33d3dac4324de2fcc4569055c0c2266b95f3b5d0bbfb6ac6a24d07c2ad2dcc","observation_id":"7f0e3b78-4b8a-4a0e-b1d8-301a544ca41d","resolution":{"observed_at":"2026-08-07T05:49:37.684760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:49:37.783145Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.783145Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:a75b0c5463c9aab62e025f1287fa087f1f95054887137d47e34b56df63a990ea","observation_id":"b0bfffb9-fc19-4282-bd12-c6c407233330","resolution":{"observed_at":"2026-08-07T05:49:37.783145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-07T05:49:37.914205Z","title":"Self-training elicits concise reasoning in large language models.arXiv preprint arXiv:2502.20122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:37.914205Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:08a978d8aa75834457503a52ec577ebf6b70bb1a43d0b5016d8d50980153cd52","observation_id":"5fb48e33-8d90-4743-a1d6-bc5beb2fc1aa","resolution":{"observed_at":"2026-08-07T05:49:37.914205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:41.976298Z","title":"Learning to reason with llms","venue":null,"work_id":"e2bac20f-169d-4a6b-bbaa-8777ed9d8975","year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.058152Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:7c1c9e564e8afd7671917428ed1ae8d6349d4486816b440440d16f7488ac2898","observation_id":"c885bb26-d3fa-4261-b1ed-9b76950c1eab","resolution":{"observed_at":"2026-08-07T05:49:42.041410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13367","last_updated":"2025-04-17T22:16:30Z","snapshot_observed_at":"2026-08-07T16:01:17.031141Z","submitted_at":"2025-04-17T22:16:30Z","title":"THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13367","snapshot_observed_at":"2026-08-07T05:49:38.203391Z","title":"Thoughtterminator: Benchmarking, calibrating, and mitigating overthinking in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.203391Z"},"links":{"cited_paper":"/paper/2504.13367","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:5f4eeae4294101d1e1670be47009fccec6255bb4b41cd6395454a011c4891f68","observation_id":"30c26e1a-4e14-4d49-b0b5-ba9f08e06c7d","resolution":{"observed_at":"2026-08-07T05:49:38.203391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:38.275527Z","title":"Optimizing anytime reasoning via budget relative policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.275527Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:76dad8a7148cc62e7330a065a2e97210e784f1aefcb8b0cd08c898a9bf80fafb","observation_id":"12d3f2f4-1a96-445b-97b0-651bbd5e1875","resolution":{"observed_at":"2026-08-07T05:49:38.275527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-10T14:40:38.654692Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:49:38.378369Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning.arXiv preprint arXiv:2503.07572, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.378369Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:5ee82837e956bfe089c6d87717a42dac7c39282e20eb7794b0515dd7cae95346","observation_id":"3b642e89-0914-4e15-873d-ee3d7fab022d","resolution":{"observed_at":"2026-08-07T05:49:38.378369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:41.804062Z","title":"Areal: Ant reasoning rl","venue":null,"work_id":"d5c2a253-accb-4068-95ca-783b77339471","year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.442171Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:04e1468c5d7a1542aabf6971d7d2204601e80d44c899ad27c2b01f94548cd000","observation_id":"b79cc64b-1687-40a8-aa04-422e5c900707","resolution":{"observed_at":"2026-08-07T05:49:41.896795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00424","last_updated":"2025-08-19T03:42:00Z","snapshot_observed_at":"2026-08-10T22:02:05.194352Z","submitted_at":"2025-04-01T05:09:04Z","title":"Hawkeye:Efficient Reasoning with Model Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00424","snapshot_observed_at":"2026-08-07T05:49:38.520326Z","title":"Hawkeye:efficient reasoning with model collaboration, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.520326Z"},"links":{"cited_paper":"/paper/2504.00424","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:aadece21017c0551c68c8185adff07640c1705667d6e14d0017d878fcbd6b967","observation_id":"1a5c1ea8-2935-407c-8dd8-4cc7c720bb0e","resolution":{"observed_at":"2026-08-07T05:49:38.520326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-07T05:49:38.588973Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.588973Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:594de60187744397f2d29c057779a7e3f5f6d6d98ff3add383879d3b2864233f","observation_id":"881669e3-6609-42a6-a6ce-41f8cef58788","resolution":{"observed_at":"2026-08-07T05:49:38.588973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:38.672014Z","title":"Dast: Difficulty-adaptive slow-thinking for large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.672014Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:cf1d05432171aa685ae1066317ccc0c0b9747ae2a14ab1127081b355e3b46598","observation_id":"da7c21a4-0088-49f6-9cba-0772561ccad2","resolution":{"observed_at":"2026-08-07T05:49:38.672014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:49:38.781973Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.781973Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:bdcd81a10076c72f93ab5d79635ebc6ea0a8f63074930503ebfbe916dd021189","observation_id":"f44f5bda-0b92-4924-abc8-e3dc9bcced9a","resolution":{"observed_at":"2026-08-07T05:49:38.781973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T05:49:38.874482Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.874482Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:98f13bf0d9ef2f4029570dcc2bdfbc092387582d80aa82cce52427309a5183de","observation_id":"1ea4eec6-f2da-4d76-8c2c-e7ede3698bc7","resolution":{"observed_at":"2026-08-07T05:49:38.874482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20290","last_updated":"2024-10-31T18:27:13Z","snapshot_observed_at":"2026-08-03T23:26:49.562857Z","submitted_at":"2024-10-26T23:20:48Z","title":"Fast Best-of-N Decoding via Speculative Rejection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20290","snapshot_observed_at":"2026-08-07T05:49:38.967912Z","title":"Fast best-of-n decoding via speculative rejection.arXiv preprint arXiv:2410.20290, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:38.967912Z"},"links":{"cited_paper":"/paper/2410.20290","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:430d9273ead996e4939f14da11b06fc0c13524b59ab48a90edc47e9c9aace2e9","observation_id":"33a60b7a-8803-4660-9fd1-0d1350d14818","resolution":{"observed_at":"2026-08-07T05:49:38.967912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:39.034718Z","title":"Confidence improves self-consistency in llms.arXiv preprint arXiv:2502.06233, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.034718Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:b70c3eb4a06ad326156e9a712079d72f1fb00a1dce96c6cc1e7729209e95afa9","observation_id":"cc5e8e5c-9620-4805-8292-b4227d436795","resolution":{"observed_at":"2026-08-07T05:49:39.034718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:49:39.110881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.110881Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:0660e4818b48c0a1e5b73edd9d28cde572be9151ee6a055645ca4599295fb921","observation_id":"62567a75-a81b-4646-a49a-eddfb5bd2f03","resolution":{"observed_at":"2026-08-07T05:49:39.110881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:41.675814Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage rl,","venue":null,"work_id":"d93069c7-30cb-4dcd-9727-4a2e0f879337","year":null},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.175313Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:3600b188f913b592a0c75d8219b15c1e3c75e1ef74cf6f8669fa6fa071c293ed","observation_id":"c2579418-fe62-44ed-a47a-5b335be1e611","resolution":{"observed_at":"2026-08-07T05:49:41.736320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:39.336776Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.336776Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:43bf451fbc7208b61cf483aa6a07f309fdc813d9246928f9c39e88e146936551","observation_id":"71bb0eea-045e-40b4-be43-5834fba86634","resolution":{"observed_at":"2026-08-07T05:49:39.336776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T05:49:39.427926Z","title":"Reinforcement learning for reasoning in large language models with one training example, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.427926Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:5d6038e2bd0c15dbe1c781c50fb6483f37221a413615418ed4ac256337e8c56f","observation_id":"f6eb5b31-48c2-4dc8-a33c-42347b1f8cf9","resolution":{"observed_at":"2026-08-07T05:49:39.427926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:39.495400Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.495400Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:6b5a05e8a4c1975c6286d6d856dc9c3564a07403dec65b2bb931f1d75a70b9f7","observation_id":"50582151-68b1-42f7-aeed-02770b8720a5","resolution":{"observed_at":"2026-08-07T05:49:39.495400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-08-10T07:36:00.576096Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05315","snapshot_observed_at":"2026-08-07T05:49:39.585269Z","title":"Scalable chain of thoughts via elastic reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.585269Z"},"links":{"cited_paper":"/paper/2505.05315","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:dfb208c331b3c0fe31a6e031fdc4872e90aaa0e840ecb486b3a91836687378ab","observation_id":"f1a8cdf3-9093-43e4-b5df-b24053add6fd","resolution":{"observed_at":"2026-08-07T05:49:39.585269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:49:39.672165Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.672165Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:8065eab4040dce7742ca88948e19adf4d76d5e1766c552ba3946f31c6032780a","observation_id":"66b4e1d8-cb54-4e43-bcdc-9bba618053fe","resolution":{"observed_at":"2026-08-07T05:49:39.672165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03234","last_updated":"2025-05-21T15:26:54Z","snapshot_observed_at":"2026-08-10T16:59:30.287515Z","submitted_at":"2025-04-04T07:34:01Z","title":"Think When You Need: Self-Adaptive Chain-of-Thought Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03234","snapshot_observed_at":"2026-08-07T05:49:39.753920Z","title":"Think when you need: Self-adaptive chain-of-thought learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.753920Z"},"links":{"cited_paper":"/paper/2504.03234","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:c84a655ce7f03964a2a04b1d8c5a74b2294b622938ead927fa913892f0f2784e","observation_id":"69f3e7db-693f-42a6-82b8-c1ec8f1dc793","resolution":{"observed_at":"2026-08-07T05:49:39.753920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:39.840510Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.840510Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:ffabbe19120238813953063c53f8f46c82d35567490699a54c6d40b8fb6d307f","observation_id":"bd9e2959-fb9d-4430-8ac5-4ba499f62c51","resolution":{"observed_at":"2026-08-07T05:49:39.840510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T05:49:39.909550Z","title":"Demystifying long chain-of-thought reasoning in llms.arXiv preprint arXiv:2502.03373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.909550Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:65acade4199a0cf8b2fab31159797e4cbb678640d3368698aeaf4153542c541f","observation_id":"6af1f9e4-a779-45f5-a6d3-8a07b84ae273","resolution":{"observed_at":"2026-08-07T05:49:39.909550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09213","last_updated":"2025-07-30T08:05:40Z","snapshot_observed_at":"2026-08-10T20:07:53.240207Z","submitted_at":"2025-01-16T00:19:19Z","title":"FineMedLM-o1: Enhancing Medical Knowledge Reasoning Ability of LLM from Supervised Fine-Tuning to Test-Time Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09213","snapshot_observed_at":"2026-08-07T05:49:39.978220Z","title":"Finemedlm-o1: Enhancing the medical reasoning ability of llm from supervised fine-tuning to test-time training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.978220Z"},"links":{"cited_paper":"/paper/2501.09213","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:8d15725bb02f4fdca719778595704bd28cd231c79d7ea6d3a4f58eba340a5ab7","observation_id":"589595c2-21f7-4948-a720-d00509f74398","resolution":{"observed_at":"2026-08-07T05:49:39.978220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06023","last_updated":"2024-07-24T18:40:36Z","snapshot_observed_at":"2026-08-10T13:49:27.550922Z","submitted_at":"2024-07-08T15:17:46Z","title":"Distilling System 2 into System 1","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06023","snapshot_observed_at":"2026-08-07T05:49:40.051297Z","title":"Distilling system 2 into system 1.arXiv preprint arXiv:2407.06023, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.051297Z"},"links":{"cited_paper":"/paper/2407.06023","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:72af57d800d9ee3178bdec5668a92ac60e63223544ae566d09bf9947f0fc3ebd","observation_id":"3def0778-7059-489c-b93e-13253303564e","resolution":{"observed_at":"2026-08-07T05:49:40.051297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:49:40.129855Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.129855Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:37a27b200979753f91d94bc5450d6b3577af592aa30434503a670ffd7bbf6d5c","observation_id":"6322f138-1f81-47ad-8802-2bdb1a21490b","resolution":{"observed_at":"2026-08-07T05:49:40.129855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00810","last_updated":"2025-04-01T14:01:50Z","snapshot_observed_at":"2026-08-10T04:26:10.893968Z","submitted_at":"2025-04-01T14:01:50Z","title":"Z1: Efficient Test-time Scaling with Code","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00810","snapshot_observed_at":"2026-08-07T05:49:40.227034Z","title":"Z1: Efficient test-time scaling with code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.227034Z"},"links":{"cited_paper":"/paper/2504.00810","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:07f55d57bba6ffa38bb2a0677bfe1df312396ae80ef976d5e96f7a91a597928b","observation_id":"da1c3027-fe12-44b0-9033-217c568dacd6","resolution":{"observed_at":"2026-08-07T05:49:40.227034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T05:49:40.307416Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.307416Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:1849d8e08d3477eaf9def28fc07f37c3704036752eb6f1d0a9080a8215e9ea5f","observation_id":"487a986d-c299-4028-900a-37dcdba052b3","resolution":{"observed_at":"2026-08-07T05:49:40.307416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-07T05:49:40.388824Z","title":"Adaptthink: Reasoning models can learn when to think, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.388824Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:b81f7e4b53c131222d70c808892fb0699cb91aaba96ad5ae4a2e2818527ee0c6","observation_id":"db605667-f43e-46e3-a2bf-6367e64205fb","resolution":{"observed_at":"2026-08-07T05:49:40.388824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-08-06T21:34:54.534751Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-08-07T05:49:40.486336Z","title":"R1-vl: Learning to reason with multimodal large language models via step-wise group relative policy optimization.arXiv preprint arXiv:2503.12937, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.486336Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:e51ccbaaf4961fed57f836207078e3ab32ecad6d53f0df037944ae5187180a4f","observation_id":"2ebf69cc-e2b5-4f41-a2a4-bcc8a30e0fa4","resolution":{"observed_at":"2026-08-07T05:49:40.486336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-07T05:49:40.577890Z","title":"The Final Answer is \\boxed{","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:40.577890Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:d4374b53d700a1ea6f1fd14f099fc308e77e29a505f525a54717560b09b3ca57","observation_id":"b26ff1b8-67af-4eb3-8ce0-a5385bfacbe9","resolution":{"observed_at":"2026-08-07T05:49:40.577890Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:49:39.249076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:39.249076Z"},"links":{"citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:558fa6cbd2393e721d5327248cf702495ccf0eefe43cbc786ddfdec1fe901235","observation_id":"29e8489d-c029-4956-befa-11f8158d156d","resolution":{"observed_at":"2026-08-07T05:49:39.249076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T18:05:29.816593Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 2 inbound Pith citation observations for arXiv:2506.07104."}