{"as_of":"2026-08-17T20:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2017f3b3f58435b28c356d40173b8a3e65aa6f2f4c1fe7b4063183620cf4116e","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:41:01.859522Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.07968/citation-record","integrity":"/paper/2608.07968/integrity","json":"/paper/2608.07968/citation-record.json","paper":"/paper/2608.07968"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-12T00:41:01.381687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.381687Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:2f260d92b35abddf8055ce4f0363bf9ec50d24e9f2a60098851dbeea4dfc14e8","observation_id":"0891c03e-988f-42cd-a3ac-fd3906027c5c","resolution":{"observed_at":"2026-08-12T00:41:01.381687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08939","last_updated":"2024-05-28T04:32:09Z","snapshot_observed_at":"2026-08-17T02:16:30.649052Z","submitted_at":"2024-02-14T04:50:18Z","title":"Premise Order Matters in Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08939","snapshot_observed_at":"2026-08-12T00:41:01.393854Z","title":"Chi, Xuezhi Wang, and Denny Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.393854Z"},"links":{"cited_paper":"/paper/2402.08939","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:a3cc54c30df29cc3a7620dd8ca63be98a3188c66fab28399557d5eab1c891468","observation_id":"c36e2aa2-dddd-4b9f-8ad9-d3efbd6dba4a","resolution":{"observed_at":"2026-08-12T00:41:01.393854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.553533Z","title":null,"venue":null,"work_id":"c9b29514-6398-49c1-9766-c09ea87e6783","year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.399787Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:365cbebc688b0ee3fa7358a65bf3f38edd258f171aa328a8b5f7fa69df44f8e4","observation_id":"a83981d8-74c8-47f8-a28f-2c9ac2de0c19","resolution":{"observed_at":"2026-08-12T00:41:03.558711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.405041Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.405041Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:cde3aead27c4522ab0fbee49cd4a7e749c2c72605b54bfbc068bf6f9b6b7c402","observation_id":"fe0929f2-58b3-4975-ad88-f4d9660e598b","resolution":{"observed_at":"2026-08-12T00:41:01.405041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-16T12:42:51.166855Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-12T00:41:01.411594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.411594Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:cdd9080a38506ea59ad371ed9aff0c4c84558c8407784677123882d69cc8a90a","observation_id":"24e1e360-8a89-4ce2-8d9d-af3e6c2c3996","resolution":{"observed_at":"2026-08-12T00:41:01.411594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-12T00:41:01.418167Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.418167Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8de0fab1272da71745965cd4d9df4b3fe47c6e0b4f0caa772ec1d652a8cc160e","observation_id":"c57a66f6-4f08-4414-8a31-2b777c9bb3e9","resolution":{"observed_at":"2026-08-12T00:41:01.418167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.424280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.424280Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:672da13a71f228d11f68d1476c2a1fbeb85a87bb7f8c1bfb9534ee2009adec90","observation_id":"d1e7f929-a5dc-4b72-8170-ebab30d6c697","resolution":{"observed_at":"2026-08-12T00:41:01.424280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.430149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.430149Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:9e3f7235e0739089d03f5b51b6f4f35914010f64686c4f02479434266e5f5453","observation_id":"9e47091e-8d91-4802-81ab-6b8ddc677b58","resolution":{"observed_at":"2026-08-12T00:41:01.430149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.527060Z","title":"Kellerer, U","venue":null,"work_id":"e7bd918b-bfa7-4aa7-acad-80a8753059f0","year":2004},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.451863Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:703f63f9aa0074ee27638a8de1db971f34a955a673080304e2a09bd47e26a321","observation_id":"c6d51948-8216-4452-8b06-68d01df07c02","resolution":{"observed_at":"2026-08-12T00:41:03.532325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.510846Z","title":null,"venue":null,"work_id":"8cacd773-77a5-4494-8f85-0ff98eb9b142","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.457101Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0c16f494da23593c871dc147234c561336ed84086fa8c6b11250291e38e07ca7","observation_id":"3c6dd6a1-36d0-49b6-8aeb-ab5015f5a77e","resolution":{"observed_at":"2026-08-12T00:41:03.516312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13752","last_updated":"2025-06-16T17:57:05Z","snapshot_observed_at":"2026-08-09T05:35:21.916120Z","submitted_at":"2025-06-16T17:57:05Z","title":"Steering LLM Thinking with Budget Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13752","snapshot_observed_at":"2026-08-12T00:41:01.462106Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.462106Z"},"links":{"cited_paper":"/paper/2506.13752","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:a59e844402f7e71f272db27d31503471514a6676683fc6d29f36b1ff22323cbd","observation_id":"1e79231b-cca8-42a1-9d4b-4dee816e09aa","resolution":{"observed_at":"2026-08-12T00:41:01.462106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.493521Z","title":null,"venue":null,"work_id":"d1adc33f-bb71-4216-acc4-bb024bbaae32","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.467400Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:494320e0343080cd405a3daaed89e6bab2f6c63177850ccf74523ed1a868e32d","observation_id":"0e57ea4b-313a-4452-a4e9-161eb44a12a2","resolution":{"observed_at":"2026-08-12T00:41:03.498825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.486912Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.486912Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:30b1f3d87b6b15e0baffa0b2875760e0cbaa743ba622a5484f4b9d6b2694c702","observation_id":"f008bbcc-ddb5-42f5-b4c6-d5d72b81d7c3","resolution":{"observed_at":"2026-08-12T00:41:01.486912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-16T12:41:30.521725Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-12T00:41:01.491586Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.491586Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:7f0191a74c5336b21a503e533f1e9c9fe1c602eb36cd5d5291e1a0fc18fe625b","observation_id":"82ece181-3732-4ea9-8ecb-a90cab3e0bf5","resolution":{"observed_at":"2026-08-12T00:41:01.491586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.496684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.496684Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b565bf25ea809043d7d46a4868b08806f7c9a80980f3542686aae23ea94df369","observation_id":"dfc92b89-b4be-47bb-a969-985b81d8c48f","resolution":{"observed_at":"2026-08-12T00:41:01.496684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13414","last_updated":"2026-05-13T12:10:05Z","snapshot_observed_at":"2026-08-12T12:38:55.266424Z","submitted_at":"2026-05-13T12:10:05Z","title":"TRIAGE: Evaluating Prospective Metacognitive Control in LLMs under Resource Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13414","snapshot_observed_at":"2026-08-12T00:41:01.501928Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.501928Z"},"links":{"cited_paper":"/paper/2605.13414","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:dd2f3dcfaa37b0d89ed8551ca844b1a293348bbad53ef1daf43bbe2fdf58670f","observation_id":"4097c561-8b8b-4b14-9927-e606ce78acc5","resolution":{"observed_at":"2026-08-12T00:41:01.501928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.465098Z","title":null,"venue":null,"work_id":"cfc33bd0-1d91-4a7d-8e01-fb03450bb121","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.507032Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8f19d8559f748314e71ca4c7fb79d53265d047365d419f3399ff3c400602c048","observation_id":"7d2a0aaa-5ab1-41a0-bff7-27a6ecf49724","resolution":{"observed_at":"2026-08-12T00:41:03.471240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-13T17:27:21.063855Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10541","snapshot_observed_at":"2026-08-12T00:41:01.511851Z","title":"Vicky Zhao, Conghui He, and Lijun Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.511851Z"},"links":{"cited_paper":"/paper/2507.10541","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0394c5f54ad26a89239040c919a954f7be67d44fecd52a7fd7da9b19fa61c5f7","observation_id":"c6db5c40-fc03-4847-ac89-107798b2046b","resolution":{"observed_at":"2026-08-12T00:41:01.511851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05563","last_updated":"2025-06-23T18:59:37Z","snapshot_observed_at":"2026-08-16T13:11:43.223334Z","submitted_at":"2024-10-07T23:48:52Z","title":"Rational Metareasoning for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05563","snapshot_observed_at":"2026-08-12T00:41:01.521998Z","title":"Nicolò De Sabbata, Theodore R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.521998Z"},"links":{"cited_paper":"/paper/2410.05563","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:76f68d27a6a7f02a8227f30c6854f23c76a9fb05ea05d1ecd5d9e4bfbbd1a3ef","observation_id":"beebbebd-9086-4016-8b42-1306fe843472","resolution":{"observed_at":"2026-08-12T00:41:01.521998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.543400Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.543400Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e57cf4ab4d07f4f981340edcec103f124ca2f8507bdce00bff7c8f87f6c37dc1","observation_id":"1dc18ca5-f88c-4971-a7ee-36d18c3ec20e","resolution":{"observed_at":"2026-08-12T00:41:01.543400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.447589Z","title":null,"venue":null,"work_id":"2205595e-7b6f-44aa-9ffc-096e3508c67b","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.548419Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:d5c0277e061090453873e5dc62b8d8b14352cf1daf2b85dd34853da9365ed89c","observation_id":"bd844c39-f763-4009-9e15-a3f753baf526","resolution":{"observed_at":"2026-08-12T00:41:03.453760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14853","last_updated":"2026-04-16T10:39:22Z","snapshot_observed_at":"2026-08-15T23:16:23.315769Z","submitted_at":"2026-04-16T10:39:22Z","title":"Adaptive Test-Time Compute Allocation for Reasoning LLMs via Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14853","snapshot_observed_at":"2026-08-12T00:41:01.568541Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.568541Z"},"links":{"cited_paper":"/paper/2604.14853","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:889e78cecd580f71dea4503999108f80f25c81b0ccd7d2e17d73654e8450bbdb","observation_id":"d4ad9fbb-b4c6-49de-964f-7a84176a9530","resolution":{"observed_at":"2026-08-12T00:41:01.568541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.578422Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.578422Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:644059219b4de84d0bb0795233f0965de97e06ad2894aecb75273fc094ab0b01","observation_id":"dcb8b2a7-93ca-4f65-a19e-8fd4e12ef664","resolution":{"observed_at":"2026-08-12T00:41:01.578422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-12T00:41:01.583289Z","title":"MathArena: Evaluating","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.583289Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:5df480cf8b6099b01bac10ffb6150c01f4ea40c322535198ff22ed322116c13c","observation_id":"b39a9677-0307-4ab6-a7ff-8cf411dd56b2","resolution":{"observed_at":"2026-08-12T00:41:01.583289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.589452Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.589452Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:bad5eece020430cd113a860c037ef61a7d39f02f64187ef709f6378c0eef6302","observation_id":"45f94fae-51f0-4902-bd1c-e8990381356b","resolution":{"observed_at":"2026-08-12T00:41:01.589452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.594821Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.594821Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:2fcc33177819a2f0e94b4b34019425a4f561c49f3396bfdb04c353dcf25435d7","observation_id":"9e114142-68e6-4629-954e-0dcb0aead0b3","resolution":{"observed_at":"2026-08-12T00:41:01.594821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.409474Z","title":"The Effect of Question Order on Evaluations of Test Performance: Can the Bias Dissolve? , volume =","venue":null,"work_id":"94ac8668-93cf-4814-9496-70f2733b08bb","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.599467Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ff71609d0609aba4c81d3c804a57fe0b862ca9e38946df6c9868bba0bf3f3642","observation_id":"3c015ef6-7e48-4ac5-95ca-90e522f7331f","resolution":{"observed_at":"2026-08-12T00:41:03.414589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.10229","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.232981Z","title":"Understanding performance in test taking: The role of question difficulty order , journal =","venue":null,"work_id":"4d19f728-028f-4c0f-b991-200339122251","year":2022},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.604549Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:57125f1ad97ffb41a9bba557c1f9e0c88eb27ab3defb96c33094e7e050bebfae","observation_id":"ba45cc57-223f-44cf-86dc-15abd0162483","resolution":{"observed_at":"2026-08-12T00:41:02.241180Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-12T00:41:01.609543Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.609543Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:cbaf83baa6d1efe9851d69758b8f02923d2c4c6389942377952ab699beedd6e9","observation_id":"e8c72946-d379-430f-9aeb-89e3e3c4af94","resolution":{"observed_at":"2026-08-12T00:41:01.609543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-16T07:06:07.822225Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-12T00:41:01.614586Z","title":"Bowman , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.614586Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:56dcf699522efa3a3023a0098d33c27b98ddc6e300aa712915e7808db6cc6e99","observation_id":"55998d3f-17e5-4bfd-8587-90bded5b3992","resolution":{"observed_at":"2026-08-12T00:41:01.614586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.619578Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.619578Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:7e28b43c35b10015d1727e0f3ed5efc82fa780119f980d94d59738b56fc95445","observation_id":"2f470ac4-f768-4691-802c-89033cc50e1a","resolution":{"observed_at":"2026-08-12T00:41:01.619578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.383482Z","title":"Measuring Ability, Speed, or Both?","venue":null,"work_id":"68548e15-a7eb-4ce7-87d5-9dc2dad6dcaa","year":2015},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.625553Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b507be4571b0f10c4b779e999751dc96453ce362333d5906b1de7951e49dd7fc","observation_id":"795537d0-59c4-476c-86c5-e73905d11ff1","resolution":{"observed_at":"2026-08-12T00:41:03.388812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.367065Z","title":"Psychometrika , volume =","venue":null,"work_id":"987e47a7-5a24-4a64-93c3-7d02ebfb3c62","year":2007},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.630372Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:42e6d66bf679a0e0a13c422b17db51b1619beed7e185d1f0c1a7e4ed416583ae","observation_id":"350b0fbc-d7b7-4807-b199-e8926f936f96","resolution":{"observed_at":"2026-08-12T00:41:03.372489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.351248Z","title":"2025 , eprint=","venue":null,"work_id":"bd82718e-bfee-45ac-b851-dc9a9cfe5e78","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.635597Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:6d294cb6325c8e5ef25c69724407cd622d05b2e155b6ad868ba5f0c369837c0a","observation_id":"001aa04a-5ac8-48ec-a9a2-68fc9acfb8e3","resolution":{"observed_at":"2026-08-12T00:41:03.356293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.640765Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.640765Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8de7eb0976bd701c66d867620e47611ddf289109bd26c144a1855b9545df153a","observation_id":"e1bdc7b8-79cf-400b-9de3-b99a641633e8","resolution":{"observed_at":"2026-08-12T00:41:01.640765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.645577Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.645577Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:63ba6770ea458fffccc29959177dfe421fccc9de1007b70b1873359bac396cbf","observation_id":"5bcb5397-d6e6-4001-9c58-d7b5bd071713","resolution":{"observed_at":"2026-08-12T00:41:01.645577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-12T00:41:01.650361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.650361Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:17a1338c55c691551f1171fd6bb61d0f06a3be7884de56c3a78ac98847f3d57c","observation_id":"7e70bca9-47d7-4deb-bc36-406e3eae3244","resolution":{"observed_at":"2026-08-12T00:41:01.650361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09891","last_updated":"2025-01-17T00:41:44Z","snapshot_observed_at":"2026-08-15T02:23:45.719567Z","submitted_at":"2025-01-17T00:41:44Z","title":"Evolving Deeper LLM Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09891","snapshot_observed_at":"2026-08-12T00:41:01.656428Z","title":"Evolving Deeper","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.656428Z"},"links":{"cited_paper":"/paper/2501.09891","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4a36472d3c64fd428b9b95096b42e42e5bbe97f4e1e15be30b7332d359eb2bac","observation_id":"b4f1daf1-95da-463a-b1f1-7908065d13f1","resolution":{"observed_at":"2026-08-12T00:41:01.656428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.314332Z","title":"2024 , eprint=","venue":null,"work_id":"26b16b1b-804e-4e3a-a3a2-9c082fcac576","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.661947Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b61cde10ffb180fb3ac6406a9a5b624335e7d5567f074c9d579a3126c040f1df","observation_id":"2ceba4bb-969b-478e-bb53-43a61de675a4","resolution":{"observed_at":"2026-08-12T00:41:03.319334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.667203Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.667203Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:30b8a067383579ae99bc4265785a4e82f52a8741289bda7654daaedc51e1fc77","observation_id":"0afa5ae3-5579-49a0-8878-ddaf68aca01d","resolution":{"observed_at":"2026-08-12T00:41:01.667203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.672029Z","title":"Proceedings of the 36th International Conference on Neural Information Processing Systems , articleno =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.672029Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4921314b7fce6c58303533a2d3abb759926d3065addfc0cc720e67635f1d78f2","observation_id":"62adc81c-13e1-4cd9-8521-c94532b63b15","resolution":{"observed_at":"2026-08-12T00:41:01.672029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.1513","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.962523Z","title":"Schoenfeld ' s Anatomy of Mathematical Reasoning by Language Models","venue":null,"work_id":"d6419e15-8c0c-49a2-9181-1423c91c00d7","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.676754Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b4f4d5008005453be04154a64fb179012ce07553c3198004356c2dfd2e63097e","observation_id":"bccdd1a9-195e-490f-9d73-b5533fa81f27","resolution":{"observed_at":"2026-08-12T00:41:01.967492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-13T23:08:15.414748+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T23:08:15.414748+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.emnlp-main.922","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.945329Z","title":"Understanding the Thinking Process of Reasoning Models: A Perspective from Schoenfeld ' s Episode Theory","venue":null,"work_id":"623a1ed1-5111-4af0-8625-70b7ba407b2a","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.681695Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1679a207cac2684e31a81aaf39977e88dfe1a31bb4bbd4743aa577f74052d8f1","observation_id":"87c1fbc0-91a5-47d6-bc82-08e7a14ae4aa","resolution":{"observed_at":"2026-08-12T00:41:01.951197Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-13T23:08:15.495798+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T23:08:15.495798+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.275745Z","title":"2025 , eprint=","venue":null,"work_id":"ba6f30d5-2f52-459c-8619-bd995b564df3","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.686315Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:89610815e86ccd31b93633ce9fe90b2e8a03d040b461276c9163bd53f5676d69","observation_id":"c2f0bd4d-10fd-4f94-86c0-51eee048dfce","resolution":{"observed_at":"2026-08-12T00:41:03.280796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06998","last_updated":"2025-06-08T05:08:32Z","snapshot_observed_at":"2026-08-17T05:12:20.202064Z","submitted_at":"2025-06-08T05:08:32Z","title":"What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding","version":1},"cited_work":{"arxiv_id":"2506.06998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.06998","snapshot_observed_at":"2026-08-12T00:41:02.729615Z","title":"What makes Reasoning Models Different? Follow the Reasoning Leader for Efficient Decoding","venue":"cs.CL","work_id":"3ab58de7-19bd-41b8-a457-ead0cbac882c","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.691063Z"},"links":{"cited_paper":"/paper/2506.06998","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b5da560ee92d2a4ce2cd7e2afdfd2cbcb2a862bb479a0abdc5f90d58d097378c","observation_id":"c9b354db-faa9-44bf-bb77-5634779ce537","resolution":{"observed_at":"2026-08-12T00:41:02.735307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-12T00:41:01.695485Z","title":"Do NOT Think That Much for 2+3=?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.695485Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:10a578d3a6e290131690ceda487d92daa18b773641e819985cfb35ad14418143","observation_id":"7f66e0b5-2fe1-4d42-9543-1d71769311f5","resolution":{"observed_at":"2026-08-12T00:41:01.695485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.259485Z","title":"2025 , eprint=","venue":null,"work_id":"f807b976-f478-49c9-afb8-2c26f4718f0f","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.699989Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:af8ce7bb2937f16e12d3699e944c4e0721f0feaa4d8541fef961b80c9d491710","observation_id":"3455fa06-2855-4bda-862e-b851fa9c29ce","resolution":{"observed_at":"2026-08-12T00:41:03.264513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.705148Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.705148Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b01447687eff36259f3db64474afbe2d915093538c7133843d6a971ebab4f872","observation_id":"5b9e465d-b957-4c2a-b2aa-2170b8c8427a","resolution":{"observed_at":"2026-08-12T00:41:01.705148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.232801Z","title":"2025 , eprint=","venue":null,"work_id":"68b4fe00-b0e6-4b8f-b020-17c48f8d7702","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.709888Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:1c32d87406c7f938f4429bb2462e21deaa83e0f9d4751da1372071083923ed30","observation_id":"a44707f9-d51e-4c70-a5b6-d4256a2d8496","resolution":{"observed_at":"2026-08-12T00:41:03.238318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-17T12:58:09.299262Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-12T00:41:01.714733Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.714733Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:075ba01c867597c6d432e15b18dbc24dbf99394d7a8848bea44ce0fbf48320fa","observation_id":"98d29c6a-0a6b-4fc7-8ce3-8d88fe6a8eb8","resolution":{"observed_at":"2026-08-12T00:41:01.714733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.215394Z","title":"2024 , eprint=","venue":null,"work_id":"6405e9a7-3d02-4f83-b37c-cf911196bd19","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.719444Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:6df9fcd99c5fea0ef154cefe137fc31ab6915ea8f95c9aaa62873887ab41de79","observation_id":"322d5b22-2436-4e40-a8e9-16bbc7dbf61a","resolution":{"observed_at":"2026-08-12T00:41:03.221633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.199518Z","title":"2025 , eprint=","venue":null,"work_id":"d90c2c63-58fb-42e2-b14a-7f57afdbedb6","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.724229Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:409d38621a6fb8bae85d30b77e4729bdf0a99a1479c6d9025d49ddc7b84c5eb3","observation_id":"4b6aa461-d16e-4b0f-b6e5-8317963f8672","resolution":{"observed_at":"2026-08-12T00:41:03.204686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.729410Z","title":"2505.20258 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.729410Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:c6311316dd1902439a62fa12e961cdd5247931844154e8bb8d46b42d61b4f930","observation_id":"c748bad4-2fa2-4962-90c6-48c9fb9b5267","resolution":{"observed_at":"2026-08-12T00:41:01.729410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.734397Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.734397Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:fdff005d9b3dc58b2941b939b114d272defd1919cfb341ccc74afcadbd9c3647","observation_id":"e949ab87-ba76-4f22-aed5-5cbfbe4e212a","resolution":{"observed_at":"2026-08-12T00:41:01.734397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.172500Z","title":"Steering","venue":null,"work_id":"cea86019-859b-41f8-aeb7-c1b9d3df339d","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.741023Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4e308d0f58f72e25f14c1e0e4ce11c3777626d88f1343b66ef2385719078a295","observation_id":"fbd94739-535e-4012-9b3a-ffe34c4b2c87","resolution":{"observed_at":"2026-08-12T00:41:03.177594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-17T15:45:29.274413Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17196","snapshot_observed_at":"2026-08-12T00:41:01.746514Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.746514Z"},"links":{"cited_paper":"/paper/2508.17196","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:668a864072ce753134e221b412a11ed1ac1dc5e92111be393d71fdf1a32c20dc","observation_id":"23abf3c3-4f00-4931-a3ac-1772b18e96d5","resolution":{"observed_at":"2026-08-12T00:41:01.746514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-16T12:59:58.216334Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-12T00:41:01.751553Z","title":"Token-Budget-Aware","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.751553Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:bc21b116872e201a6ec770c368ccb3052b0b6b8405a50ca75508531f56a37596","observation_id":"7ffd88c9-8457-48b3-bd33-cca9bd3daf2b","resolution":{"observed_at":"2026-08-12T00:41:01.751553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T00:41:01.756037Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.756037Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:21450bb7ae4cd02c5460764d251960e515e00cc40380d3fb2ef0afbb671b4a68","observation_id":"959fcbcb-80ee-404e-87c5-b834383b7dea","resolution":{"observed_at":"2026-08-12T00:41:01.756037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-12T00:41:01.760731Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.760731Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:2a4c385819d8c5c0de62081067124ba064e040233f896782344090e6fc09d96a","observation_id":"b883ea27-5b70-493d-8bfa-8f0366f8e815","resolution":{"observed_at":"2026-08-12T00:41:01.760731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-12T00:41:01.765737Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.765737Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:9378402ae05d90e0fc0fee5231cc7cf41144ca120912391de408dc37a88af169","observation_id":"02ba01e8-73bc-4b8e-af1c-bded7e17838e","resolution":{"observed_at":"2026-08-12T00:41:01.765737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.156188Z","title":"2025 , school=","venue":null,"work_id":"38314d93-b070-4c85-a701-5319d4d7f750","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.770483Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:6b637ede1e65ea81fdae152f302fd5351c433171eeae0220613b989d1c5ba254","observation_id":"38cadad6-4259-4a96-8b7f-7b2136aa0340","resolution":{"observed_at":"2026-08-12T00:41:03.161418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.775466Z","title":"2024 , editor =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.775466Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:76edaa3b07b6a99846273c62db2bcfd4cd4deb394c3d96d042f4de9d9c5742e2","observation_id":"de346e61-1bbc-4026-bc20-66a0efc73ead","resolution":{"observed_at":"2026-08-12T00:41:01.775466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.130248Z","title":"Vicky and He, Conghui and Wu, Lijun , journal=","venue":null,"work_id":"4edd35d6-f473-4d8b-b8e0-be932caf646a","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.780060Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:b5db8e97ecc926c5002a14aa1277ea78c677d49e305cffffb5d0c189e2bd4311","observation_id":"59c9d35d-7aa3-4063-a868-836b6b2e5c2d","resolution":{"observed_at":"2026-08-12T00:41:03.135049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.114771Z","title":null,"venue":null,"work_id":"241a1d67-4ea3-4e0b-a5bf-1c2a1a1bdd78","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.785348Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:ae4cc5ec0a55d998b3c1febb6a3f555b035a6590caebd10eb5706cee38215a9a","observation_id":"83b520ca-ec2e-4e2b-bd0b-f03bfd6dd464","resolution":{"observed_at":"2026-08-12T00:41:03.119699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.098657Z","title":"Triage: Evaluating Prospective Metacognitive Control in","venue":null,"work_id":"5d9db299-5bb1-4122-9eee-9816cd035ffc","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.790753Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:5c894ef89f03e6e983b1c31299acb95f8ab3cb5a51d5785ef9951d6d2856cac4","observation_id":"c2ab9dbb-bc4a-46fe-9148-3d0a003d66ef","resolution":{"observed_at":"2026-08-12T00:41:03.103967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.796046Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.796046Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:c4efc4c80bf37e502b3e0ae40b8ae30d38b6f183571a0baae5b3ab5077f2c91f","observation_id":"2e15344c-3520-43e3-857e-eb72744a3d88","resolution":{"observed_at":"2026-08-12T00:41:01.796046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.071400Z","title":"2004 , publisher=","venue":null,"work_id":"2c93d2f6-69f4-4c9a-b152-054716fca99d","year":2004},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.800860Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:8208f2627195749fd36dba27bf09ce25d69b286a00b0e2ad78a0626855f60e6e","observation_id":"28dbad17-7757-4a1c-996e-a8c882072226","resolution":{"observed_at":"2026-08-12T00:41:03.076743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.053870Z","title":"Proceedings of the 2023 Conference on Empirical Methods in Natural Language Processing: Industry Track , pages=","venue":null,"work_id":"d5c5c966-cbfe-4834-978d-ebb495a67e18","year":2023},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.806153Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:13e5b0e435ece436fa2a56c95ffe24accfd4bbe9da2ba26adfcd783015f5311e","observation_id":"2fd2b7ff-db75-487d-82ef-ab8932557dc4","resolution":{"observed_at":"2026-08-12T00:41:03.059676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.037094Z","title":"Proceedings of the Fourth Workshop on Generation, Evaluation and Metrics (GEM ^2 ) , pages=","venue":null,"work_id":"7f8cc238-4db7-4ee4-91f3-37d22db92f4c","year":null},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.811123Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:032c404fb375f586ebf096b6f534272557b2483cb481992750db2a1f1cb358dc","observation_id":"df540463-70bf-485e-8bca-aecadff2c02c","resolution":{"observed_at":"2026-08-12T00:41:03.042496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.019024Z","title":"Findings of the Association for Computational Linguistics: ACL 2025 , pages=","venue":null,"work_id":"110aeaed-668d-4a57-a0e7-a383a152298f","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.815707Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4ee68034bdfc835a563cebc0877cce40ec1164a2578d92de27f25a2d8b0e0ec3","observation_id":"c10b7745-4918-4cb8-913b-893c5a6ce7b6","resolution":{"observed_at":"2026-08-12T00:41:03.024975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:03.002423Z","title":"2024 , eprint=","venue":null,"work_id":"c7fc72e1-113c-4997-92a6-cc13b8746323","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.820659Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:e7d26e2e9d33ec0c8ac611809da782ec2665ce9d9a630bb0bfe5d9530257e54d","observation_id":"3d865c5b-efd8-4067-a03e-8049daa54a6e","resolution":{"observed_at":"2026-08-12T00:41:03.007398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.826544Z","title":"Reasoning in Token Economies: Budget-Aware Evaluation of LLM Reasoning Strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.826544Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4fab123b6ff2c24b13444fd387338b463fa08ed7a533769603ef6974effce8f7","observation_id":"35c98bfe-2135-41a1-aa2e-6458714b4200","resolution":{"observed_at":"2026-08-12T00:41:01.826544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.findings-acl.417","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.893781Z","title":"and Ballesteros, Miguel and Chilton, Lydia and Yu, Zhou and Roth, Dan","venue":null,"work_id":"d598fffe-c7d3-4ca1-b790-1aecf8e7bef4","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.831285Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:4b7b54f7e4bd10a0d6e7004c6494cc5da314b7f840b5e5afdd9611ff9ba081b6","observation_id":"adf4188b-1747-4ee4-addf-dbe0e0d42191","resolution":{"observed_at":"2026-08-12T00:41:01.900187Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-13T23:08:15.694803+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T23:08:15.694803+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.985685Z","title":"2026 , eprint=","venue":null,"work_id":"28202cf8-82cb-4da1-bb90-5b4504d4ba69","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.836009Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:282a812d491c73cfd12f847b7681072aae978dddc50215817a81426ba9fa5ee7","observation_id":"c7787c17-3336-4180-b41d-0e10a91e2453","resolution":{"observed_at":"2026-08-12T00:41:02.991643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.969682Z","title":"2024 , eprint=","venue":null,"work_id":"7871603f-1d1e-46d9-9cfb-543beed9c422","year":2024},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.840878Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:0f8a0384fdd24a057bb81ad747e7c079029f6087d964f46afd4fac92dfc2ddcb","observation_id":"87c1132b-c7f8-47db-b4c4-8d86ccce8c87","resolution":{"observed_at":"2026-08-12T00:41:02.974821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.845697Z","title":"Characterizing Positional Bias in Large Language Models: A Multi-Model Evaluation of Prompt Order Effects","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.845697Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:127606bdc966dc1b0555f190b5d488237e7e55aef683ca760f7fafe4c15a3aec","observation_id":"299e3819-bc02-4c5a-9cce-e15092b510e0","resolution":{"observed_at":"2026-08-12T00:41:01.845697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:01.850325Z","title":"Principles of metareasoning , journal =","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.850325Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:90c437a46261812a9df284e675a912d8bb4d6ee2ff1b68f2f8298216098c9449","observation_id":"1aba4f11-beef-4dbe-bc1e-3d42135e1f73","resolution":{"observed_at":"2026-08-12T00:41:01.850325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.954094Z","title":"2025 , eprint=","venue":null,"work_id":"beeda997-6790-492c-a5a7-5982c64a8a5a","year":2025},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.854785Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:3566413a8729ca71984195b326d3d77a5dc3ce09cd6954d293fc8b58e4f323d3","observation_id":"b2920928-d2d5-4446-b23c-6b23f33e40ec","resolution":{"observed_at":"2026-08-12T00:41:02.958973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T00:41:02.937049Z","title":"2026 , eprint=","venue":null,"work_id":"f15a32b6-0404-4e76-8fc7-c5628920c9fd","year":2026},"citing_paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-12T00:41:01.859522Z"},"links":{"citing_paper":"/paper/2608.07968"},"observation_digest":"sha256:71bbb30ca1a5631d8593097fd3318db1d7fa93104aa26a180a49fd038f0e7ba6","observation_id":"f97fd9d8-20b2-43b8-a8ba-735b0db5ee21","resolution":{"observed_at":"2026-08-12T00:41:02.942367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.07968","last_updated":"2026-08-11T02:23:08Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T23:09:45.697398Z","submitted_at":"2026-08-08T07:04:28Z","title":"Thinking Hard, Not Smart: Reasoning Models Fail to Ration Test-Time Compute Across Questions"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":50,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 0 inbound Pith citation observations for arXiv:2608.07968."}