{"as_of":"2026-08-21T11:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de7923c59a79938b42892276704cd797aec4319c06e5187e6b37624d811af4f8","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T22:11:34.020610Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:16:03.077573Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T19:43:44.121220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":"2505.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":"33945f95-e9a3-476d-bc19-3bf159e1763b","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":240,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:c137880ee51d83cb4ad0d76bb07dd25df0155c5c06889d8dca0f492f91503f12","observation_id":"a90e90b1-f664-4c52-a947-aabcf031f41f","resolution":{"observed_at":"2026-05-14T01:29:57.422076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-08-15T19:16:03.077573Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17211","last_updated":"2025-06-20T17:59:07Z","snapshot_observed_at":"2026-08-18T12:21:48.819822Z","submitted_at":"2025-06-20T17:59:07Z","title":"BREAD: Branched Rollouts from Expert Anchors Bridge SFT & RL for Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:16:03.077573Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2506.17211"},"observation_digest":"sha256:cb48914fc8057f4ea6e7db72f7ebf67e89a0840af3818d0ebf8b0932146b42ea","observation_id":"6820098a-2d10-4b21-ae17-00996f34dbae","resolution":{"observed_at":"2026-08-15T19:16:03.077573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":"2505.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":"33945f95-e9a3-476d-bc19-3bf159e1763b","year":2025},"citing_paper":{"arxiv_id":"2506.17788","last_updated":"2026-04-10T15:38:19Z","snapshot_observed_at":"2026-08-18T23:50:56.641668Z","submitted_at":"2025-06-21T18:45:28Z","title":"Bayesian Social Deduction with Graph-Informed Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-19T07:27:20.027179Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2506.17788"},"observation_digest":"sha256:284847d45835b4952b5374d7e992ee01e3c023caa5fa30cf773a36561ba301b8","observation_id":"caafa4cf-1572-4ec2-90a7-2cb382e35772","resolution":{"observed_at":"2026-05-19T07:32:09.410714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":"2505.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":"33945f95-e9a3-476d-bc19-3bf159e1763b","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-08-17T00:27:13.360022Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":233,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:b39a860f048d5138e15d31c1dc77ce3d5039f79fe3ef87653563189c13fda90d","observation_id":"8c401132-526a-4f28-975e-e06499a9d6a7","resolution":{"observed_at":"2026-05-11T20:06:09.979128Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":"2505.07961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Making small language models efficient reasoners: Intervention, supervision, reinforcement","venue":null,"work_id":"33945f95-e9a3-476d-bc19-3bf159e1763b","year":2025},"citing_paper":{"arxiv_id":"2605.15604","last_updated":"2026-05-15T04:31:06Z","snapshot_observed_at":"2026-08-15T07:44:11.913959Z","submitted_at":"2026-05-15T04:31:06Z","title":"VSPO: Vector-Steered Policy Optimization for Behavioral Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T19:39:55.294398Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2605.15604"},"observation_digest":"sha256:0a422fda4116f0d74d0f5f794ff5a947b0f41436ac534e69c2fce1833268f87f","observation_id":"6788d978-46b9-445a-9287-e00caccf6347","resolution":{"observed_at":"2026-05-20T19:43:44.123476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-07-14T07:09:11.486851Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11089","last_updated":"2026-07-13T04:57:22Z","snapshot_observed_at":"2026-08-16T19:27:16.268533Z","submitted_at":"2026-07-13T04:57:22Z","title":"OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T07:09:11.486851Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2607.11089"},"observation_digest":"sha256:47cddd55cecf24f1d247b401172af5fd2db40c117d3f11b9aec32be1689eef81","observation_id":"8f3b2d51-b066-417b-b03b-9934dd5d82f7","resolution":{"observed_at":"2026-07-14T07:09:11.486851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07961","snapshot_observed_at":"2026-08-02T08:56:34.604372Z","title":"(2025a).Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement.CoRR, abs/2505.07961","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-07T06:27:15.086404Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:34.604372Z"},"links":{"cited_paper":"/paper/2505.07961","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:8efa466849d8bf5bb54aace2e804296124c36693c7e16382d11a6501c2f02e3a","observation_id":"6a2788d7-a87f-4422-ad06-7d008e98f891","resolution":{"observed_at":"2026-08-02T08:56:34.604372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07961/citation-record","integrity":"/paper/2505.07961/integrity","json":"/paper/2505.07961/citation-record.json","paper":"/paper/2505.07961"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-17T16:48:59.674177Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T22:11:33.877772Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.877772Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:61fad96f3491f180fad1bc2303d2443e4fcbee851028c7393a102871f5936b93","observation_id":"8d396b3e-ca1c-42b2-80c0-76af3d123a3b","resolution":{"observed_at":"2026-08-15T22:11:33.877772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07279","last_updated":"2025-03-25T03:36:21Z","snapshot_observed_at":"2026-08-18T12:49:11.537713Z","submitted_at":"2024-11-11T18:59:45Z","title":"The Surprising Effectiveness of Test-Time Training for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07279","snapshot_observed_at":"2026-08-15T22:11:33.883525Z","title":"The surprising effectiveness of test-time training for few-shot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.883525Z"},"links":{"cited_paper":"/paper/2411.07279","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:e507d4da7264111a6540cfd5824d7de7ec292931bfd0be49914be7dc1df7656a","observation_id":"c87e41e7-106a-4d93-954e-18bc23e143de","resolution":{"observed_at":"2026-08-15T22:11:33.883525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11937","last_updated":"2024-12-16T16:22:27Z","snapshot_observed_at":"2026-08-17T23:11:09.247740Z","submitted_at":"2024-12-16T16:22:27Z","title":"Precise Length Control in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11937","snapshot_observed_at":"2026-08-15T22:11:33.887907Z","title":"Precise length control in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.887907Z"},"links":{"cited_paper":"/paper/2412.11937","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:1a31f5aff5e8dd4ace038d28fe99b9b23672c684f941a176386d8812bf4a223d","observation_id":"50380b6f-a70b-4f9a-94cc-0d5ef0ec6303","resolution":{"observed_at":"2026-08-15T22:11:33.887907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-08-10T11:59:11.481480Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-15T22:11:33.892890Z","title":"Frugalgpt: How to use large lan- guage models while reducing cost and improving performance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.892890Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:58688b9d5c81a084a0f238f9fc775819e8e88586748a77b1f0477b00f22147b4","observation_id":"734d0927-4c52-4467-a238-670416fd82ec","resolution":{"observed_at":"2026-08-15T22:11:33.892890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-16T07:57:19.216626Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-15T22:11:33.897078Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.897078Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:fada0cb3c15643a79d009717c397839591e69c49dee2dded43544e075ecb7877","observation_id":"e2b6c686-0811-4902-80a7-94087760d863","resolution":{"observed_at":"2026-08-15T22:11:33.897078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.637136Z","title":"Gemini 2.0 flash thinking mode (gemini-2.0f lash-thinking-exp-1219), 2024","venue":null,"work_id":"d768859c-f8bf-4fa4-ac32-0d76619152fa","year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.901046Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:266e2e327464796a346bc552c5a0ae19d716c5259545684a0a686ad2abe1b6a1","observation_id":"a60b0daa-05dc-4f83-95f0-d20e549d7e22","resolution":{"observed_at":"2026-08-15T22:11:34.641536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.905805Z","title":"Test-time training provably improves transformers as in-context learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.905805Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:8e8f1fb307a9ebc193c501702e3b12410b65d3c9d51af25e74adacd01879a998","observation_id":"58b1928c-096f-4a7d-aa3d-e4ce852ead83","resolution":{"observed_at":"2026-08-15T22:11:33.905805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T22:11:33.910188Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.910188Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:aa9c9d15469c797e9d56b9eebd6f7f98bb5215a47f373ebcafe5572fe79eac48","observation_id":"df98ec15-9c2c-45de-8b48-d13c6d332cd3","resolution":{"observed_at":"2026-08-15T22:11:33.910188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10136","last_updated":"2024-04-15T21:02:48Z","snapshot_observed_at":"2026-08-19T23:19:03.909719Z","submitted_at":"2024-04-15T21:02:48Z","title":"Language Model Cascades: Token-level uncertainty and beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10136","snapshot_observed_at":"2026-08-15T22:11:33.914295Z","title":"Language model cascades: Token-level uncertainty and beyond","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.914295Z"},"links":{"cited_paper":"/paper/2404.10136","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:19a05202e4e10f35cee2c9e19ae5e36f63b0e5f7ec7caea7a57ffd3abd3df04b","observation_id":"ae9df6fc-5089-4b4e-af9e-b27fbdbcda68","resolution":{"observed_at":"2026-08-15T22:11:33.914295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-17T12:58:09.299262Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-15T22:11:33.918046Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.918046Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:4261dec58b16480dfbbf89176c88fbb1a43e5a723f8df2e52ef2763ecf88f054","observation_id":"06e46da3-438e-4daa-978b-9dfe39d5fd7a","resolution":{"observed_at":"2026-08-15T22:11:33.918046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T22:11:33.921887Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.921887Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:9ad5230df1615d9f299106d923f99423d28f8ff0739f5de27739722d98e9b116","observation_id":"d77aac5a-79c2-46f2-ac1c-d4b8ee6c0d13","resolution":{"observed_at":"2026-08-15T22:11:33.921887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.625922Z","title":"Fast inference from transformers via speculative decoding","venue":null,"work_id":"5fe048e4-4e73-4ba3-bada-d0b464cf40ec","year":2023},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.925186Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:e0122abcae88149e68a2235d1c623558b6f0b7dcae5d719d559181b4d35cca71","observation_id":"9dc70092-78b9-4b5b-afde-f8834b657351","resolution":{"observed_at":"2026-08-15T22:11:34.629933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.614392Z","title":"Autobalance: Optimized loss functions for imbalanced data","venue":null,"work_id":"fdd49f42-5a15-47a9-a2ef-2c4086a18599","year":2021},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.928576Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:c7d6de777861912ee353a3d45cad938f621bbfdfa20cdfb711c1d5c5a42d4e50","observation_id":"2e33c4ad-7933-458f-a900-2c504879f806","resolution":{"observed_at":"2026-08-15T22:11:34.618115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.931708Z","title":"Small models struggle to learn from strong reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.931708Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:c1477371a45fb0a476d4a3f8040643b00d5c0dd8beb475f3744c009d8868258f","observation_id":"20a9a835-c90b-4c5e-806a-38350e17314d","resolution":{"observed_at":"2026-08-15T22:11:33.931708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.935195Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.935195Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:1584d11b753d296ceab2aaea5a6cb8d52678e5a1c7c4fd7335b28c7a77d834b2","observation_id":"622e7f77-58bb-4f78-bce7-d89a22e1bf4f","resolution":{"observed_at":"2026-08-15T22:11:33.935195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.938798Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.938798Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:a8a98e265e4d78b5618510e33b3857cbab74e49c512a9e9c6d3d83502c3e6320","observation_id":"b1cd46e9-9114-4316-91df-8934f2b3eb7c","resolution":{"observed_at":"2026-08-15T22:11:33.938798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.590815Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"e266b475-3f67-4475-bf11-96e9c477225a","year":null},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.942182Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:c800f77827903a3441a35e3020531dec4b75600d6c196ba3f3a103a204ad6383","observation_id":"c5093dcf-123c-4933-8cfa-b9efb290d97e","resolution":{"observed_at":"2026-08-15T22:11:34.594816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.946059Z","title":"Long-tail learning via logit adjustment","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.946059Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:92a66b5f45fc1ce8e0adad438fb18685c2212bff4c9c8edaa66448a1fd4e09f0","observation_id":"289ba2ba-3319-49a3-bb7a-f9d0643dcc30","resolution":{"observed_at":"2026-08-15T22:11:33.946059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T22:11:33.949614Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.949614Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:3d814ff5f6fd8b7bc67634549b5c23a1bb732a76ba2a8a61440aabade6c02bfc","observation_id":"283a70c5-b00c-4a19-bb2a-62ee448c36a9","resolution":{"observed_at":"2026-08-15T22:11:33.949614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.574045Z","title":"Gpt-4o mini: advancing cost-efficient intelligence, 2024","venue":null,"work_id":"e484a705-5f97-4d9d-8836-620e7cd7de49","year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.953453Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:03b86156e93a6d7e35d1b07a7c419056db96f24180735e2795e0250ada404c7d","observation_id":"b2e8ccc2-6e5a-41c1-ab96-fd265de3eab9","resolution":{"observed_at":"2026-08-15T22:11:34.577740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.957798Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.957798Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:ba47a1bbd8c3bee8a767f147a017b6a85381396ec4b332a6d3a2c769b1aa6e8e","observation_id":"e972ac4f-18f0-4cdd-8a9d-7a15da8a7927","resolution":{"observed_at":"2026-08-15T22:11:33.957798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-16T23:51:04.345453Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-15T22:11:33.962269Z","title":"Scaling test-time compute without verification or rl is suboptimal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.962269Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:c80091f6f2174cedafc6c555fa7ff6b594b7fd83ca8284004e665051c4094213","observation_id":"2e45beb1-1e63-4b61-af85-f924f23096fc","resolution":{"observed_at":"2026-08-15T22:11:33.962269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-15T22:11:33.967068Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.967068Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:2793c720822ae3b2177557c064895c0ce646b768503f77f6a1403dbf260a095b","observation_id":"3b883b6d-825e-40e2-8a28-c751a8bc144a","resolution":{"observed_at":"2026-08-15T22:11:33.967068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T22:11:33.971434Z","title":"Scaling llm test-time com- pute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.971434Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:afe461e39b5c0fe7c2c046721008fcc363df372bc3f2c84b294021b917cd800a","observation_id":"bf1e8d8b-aeff-4d37-80c8-d49962fd5640","resolution":{"observed_at":"2026-08-15T22:11:33.971434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-08-18T03:20:04.325807Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05315","snapshot_observed_at":"2026-08-15T22:11:33.975998Z","title":"Scalable chain of thoughts via elastic reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.975998Z"},"links":{"cited_paper":"/paper/2505.05315","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:0a64571bf87f85e3dc3ac6874fea0fb85d2c022d0dacdb3a6ae9329488e5cc35","observation_id":"515e1ab3-531f-4550-b5f1-783b83f88ef4","resolution":{"observed_at":"2026-08-15T22:11:33.975998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T22:11:33.979744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.979744Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:8aa0595606949254020cc7673146782db8546fe9eb9419b4b69d7ba3e231aba2","observation_id":"e0a603d5-c187-43de-afcc-3bcf18c85c01","resolution":{"observed_at":"2026-08-15T22:11:33.979744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-20T14:18:10.920944Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-15T22:11:33.983505Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.983505Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:745510f226ebc262a90cce41c3f2e6d801febfb5d0f5180397e6aca8fb4df2aa","observation_id":"974af263-8d69-4ade-92f7-82521c49154f","resolution":{"observed_at":"2026-08-15T22:11:33.983505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:33.987395Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.987395Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:175c7ea51857768de45e9e780019cd1f15881b25960720668eb9f9c17babf889","observation_id":"c09474c1-4f25-499c-831b-50a3951f0c2a","resolution":{"observed_at":"2026-08-15T22:11:33.987395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17744","last_updated":"2024-06-25T17:29:52Z","snapshot_observed_at":"2026-08-16T20:48:00.272359Z","submitted_at":"2024-06-25T17:29:52Z","title":"Following Length Constraints in Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17744","snapshot_observed_at":"2026-08-15T22:11:33.991234Z","title":"Following length constraints in instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.991234Z"},"links":{"cited_paper":"/paper/2406.17744","citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:2322633e881c89c815467dc881d50ed995a6fe15d0830189918d627cf57a5503","observation_id":"1a7ccb58-5918-45cb-b07c-a8493b5f62cb","resolution":{"observed_at":"2026-08-15T22:11:33.991234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.556273Z","title":"Selective attention: Enhancing transformer through principled context control","venue":null,"work_id":"83bf6699-736f-4597-9b44-724fbcdd443b","year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.995774Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:6d0e9550c78f68018b3c554ea5434eb67badc61c0ff8de7bec20cc0e317b5113","observation_id":"723c00b6-029d-4125-817b-5881c65d56c4","resolution":{"observed_at":"2026-08-15T22:11:34.560114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.543669Z","title":"Efficient contextual LLM cascades through budget-constrained policy learning","venue":null,"work_id":"e255ea0a-fe74-4f70-b512-2d0fff176110","year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:33.999567Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:1c0fd2c4e5f3e040498ea45757d7121c3779d72c779709c63b763b7c9adae1d6","observation_id":"341dd39d-09de-457a-9e35-50c36a47f104","resolution":{"observed_at":"2026-08-15T22:11:34.547918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.531598Z","title":"Class-attribute priors: adapting optimization to heterogeneity and fairness objective","venue":null,"work_id":"02edb537-8aa8-4a98-8ee1-5858ba54ede4","year":2024},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:34.003119Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:09ff8d0deb3d6ab180100007cdd43dfbb33722275db1e826f8e4e1693dac6c32","observation_id":"95e6457c-71a2-4a0b-ab20-f7906668edc1","resolution":{"observed_at":"2026-08-15T22:11:34.535486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.520445Z","title":"Pleaseanalyze the following text and determine if there are any meaningless repetitions of identical sentences","venue":null,"work_id":"ed15274d-5177-4415-bf30-518c2c7493de","year":null},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:34.007830Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:99bd4c54ab56ece3c43f6622b5fc98c683c0a67b363db0e178d454792567c394","observation_id":"e4933300-2e03-433c-a78c-bcb55c7094e3","resolution":{"observed_at":"2026-08-15T22:11:34.524261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.507680Z","title":"If the model prematurely generates the end-of-thinking token before reaching the desired length, the token is removed, and generation continues until the target length is reached","venue":null,"work_id":"b1339002-26ec-448d-9e45-4f0e3cfd83ab","year":null},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:34.011237Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:cf2995df3bb51c669f588cf3d2e79769e5a89dabe7573edd58b5a99390779dca","observation_id":"cf0b46b3-7ea4-4360-939d-7f887e96ca61","resolution":{"observed_at":"2026-08-15T22:11:34.512528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.495160Z","title":null,"venue":null,"work_id":"44cbf208-28a8-4878-96ba-4f9be800e6db","year":null},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:34.016188Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:fdcbc4a484d97a75b9b39ab4de4166d51b7cc42af5e6d0b2da6b120e4688cd5e","observation_id":"9d808209-4fd3-4a47-bac1-8d66ce1414bc","resolution":{"observed_at":"2026-08-15T22:11:34.499056Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3387.5311","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T22:11:34.103236Z","title":"2k” and “4k","venue":null,"work_id":"ef97fe31-d427-46ec-94b9-c448e5eb48c0","year":2000},"citing_paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T22:11:34.020610Z"},"links":{"citing_paper":"/paper/2505.07961"},"observation_digest":"sha256:2b29ac03daba8d6c122745e8478acecf8a279aa0f65bdede2595c95508ab1455","observation_id":"7f619b3d-b0d2-4d11-b6b4-f3d34b2dbe8a","resolution":{"observed_at":"2026-08-15T22:11:34.111991Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07961","last_updated":"2025-05-23T04:50:59Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T00:41:54.603816Z","submitted_at":"2025-05-12T18:04:39Z","title":"Making Small Language Models Efficient Reasoners: Intervention, Supervision, Reinforcement"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 7 inbound Pith citation observations for arXiv:2505.07961."}