{"as_of":"2026-08-13T06:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f8bda85298d7d6596aa298c8381ea7a0ca42b9eea80cdb74425bbda48825210e","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:38:09.532937Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.219235Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T11:37:03.402806Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-06T17:54:17.219235Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-11T20:23:03.012064Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.219235Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:0f5c44a9e4a846d5b71c61dbd0ff6391b537e40898a837f99fbc340c63d023e5","observation_id":"1b70cf35-6073-4738-a278-6306d0f96f9e","resolution":{"observed_at":"2026-08-06T17:54:17.219235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-05T11:50:15.945247Z","title":"Fast on the easy, deep on the hard: Efficient reasoning via powered length penalty","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-13T05:03:31.225779Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:15.945247Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2509.02208"},"observation_digest":"sha256:438d9704860435e7db37578df006b3ea0c17b2b9ce898aabfd8a8ffc26010dc4","observation_id":"53d96970-d5c3-4493-a872-35f66a92d696","resolution":{"observed_at":"2026-08-05T11:50:15.945247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-05T11:50:16.038483Z","title":"URL https://doi.org/10.48550/arXiv.2506","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02208","last_updated":"2025-09-02T11:23:35Z","snapshot_observed_at":"2026-08-13T05:03:31.225779Z","submitted_at":"2025-09-02T11:23:35Z","title":"Baichuan-M2: Scaling Medical Capability with Large Verifier System","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T11:50:16.038483Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2509.02208"},"observation_digest":"sha256:fb522eba988ccea286ccd5357cbdc7451551868a99351f659bcb93833c1b7105","observation_id":"466f95ac-15c9-42fd-8d4e-9166aa94374e","resolution":{"observed_at":"2026-08-05T11:50:16.038483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-04T07:59:52.963465Z","title":"Fast on the easy, deep on the hard: Efficient reasoning via powered length penalty.arXiv preprint arXiv:2506.10446,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-09T00:53:49.879051Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:52.963465Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:0571ccf7934d239d4e9ea551fc53ab684f881b485afbc3ecf8501a137132e43a","observation_id":"8665faff-1f48-4338-90cc-d2a77ebdebf2","resolution":{"observed_at":"2026-08-04T07:59:52.963465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-03T03:04:43.959361Z","title":"Bias unveiled: Investigating social bias in llm-generated code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.959361Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:4d5091f8b10de46af4b21ef9803a0e52ea67387e10c14df6427a7c35a0018537","observation_id":"6a3c8790-f987-4c3a-9320-c06007867427","resolution":{"observed_at":"2026-08-03T03:04:43.959361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-08-02T20:44:45.635731Z","title":"arXiv:2506.10446 doi:10.48550/ARXIV.2506","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.22642","last_updated":"2026-06-18T19:10:56Z","snapshot_observed_at":"2026-08-12T17:05:29.500530Z","submitted_at":"2026-02-26T05:47:30Z","title":"Compress the Easy, Explore the Hard: Difficulty-Aware Entropy Regularization for Efficient LLM Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:44:45.635731Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2602.22642"},"observation_digest":"sha256:7568a89e44254e6f6a65d8ea82723c41c4d73da2d5e1c70a96d4d05c03672743","observation_id":"51a4b97b-b9c2-44c7-921f-bab23716752b","resolution":{"observed_at":"2026-08-02T20:44:45.635731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":"2506.10446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-07-10T11:37:03.402806Z","title":"arXiv preprint arXiv:2506.10446 , year=","venue":"cs.CL","work_id":"e153fd26-2a21-4d09-94e5-4ad4496f8fbe","year":2025},"citing_paper":{"arxiv_id":"2604.19773","last_updated":"2026-03-27T12:13:20Z","snapshot_observed_at":"2026-08-03T12:53:29.360699Z","submitted_at":"2026-03-27T12:13:20Z","title":"PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T23:17:29.025222Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2604.19773"},"observation_digest":"sha256:1dd9a72309cd06f55305a6be83762dca86f4483b4f41a3c301f3c7cb43aa3b48","observation_id":"357fa96c-7cad-4d73-ab57-e01601f11fd8","resolution":{"observed_at":"2026-05-14T23:18:15.685504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":"2506.10446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-07-10T11:37:03.402806Z","title":"arXiv preprint arXiv:2506.10446 , year=","venue":"cs.CL","work_id":"e153fd26-2a21-4d09-94e5-4ad4496f8fbe","year":2025},"citing_paper":{"arxiv_id":"2605.14126","last_updated":"2026-05-13T21:27:21Z","snapshot_observed_at":"2026-08-11T15:44:40.919648Z","submitted_at":"2026-05-13T21:27:21Z","title":"Reinforcement Learning for Tool-Calling Agents in Fast Healthcare Interoperability Resources (FHIR)","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T04:56:21.439473Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2605.14126"},"observation_digest":"sha256:c8f7b4093c330511a7a39821be12bcfbece0a9932a11994ce66e97a979af6d20","observation_id":"e22b7477-10a0-4a34-b13e-281a7de1e7e1","resolution":{"observed_at":"2026-05-15T04:59:45.773704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":"2506.10446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-07-10T11:37:03.402806Z","title":"arXiv preprint arXiv:2506.10446 , year=","venue":"cs.CL","work_id":"e153fd26-2a21-4d09-94e5-4ad4496f8fbe","year":2025},"citing_paper":{"arxiv_id":"2605.30832","last_updated":"2026-05-29T04:37:49Z","snapshot_observed_at":"2026-07-06T23:40:03.151978Z","submitted_at":"2026-05-29T04:37:49Z","title":"SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:27:30.783923Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2605.30832"},"observation_digest":"sha256:a5b28bc0dcea1ad474e829eadce8cf6e256d1b1bbfe84ad26ed96caca3f14425","observation_id":"9b9a0fb6-a743-4d4a-bbc2-5ae534685e3d","resolution":{"observed_at":"2026-06-28T22:32:44.446460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":"2506.10446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-07-10T11:37:03.402806Z","title":"arXiv preprint arXiv:2506.10446 , year=","venue":"cs.CL","work_id":"e153fd26-2a21-4d09-94e5-4ad4496f8fbe","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:c4cad3eea2865ffcb945ccafd17170de4a0e619ab353f48084a341c15b21d541","observation_id":"a82d171d-7af1-424e-9a02-6588c10dc8c2","resolution":{"observed_at":"2026-07-04T09:19:43.868020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"cited_work":{"arxiv_id":"2506.10446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.10446","snapshot_observed_at":"2026-07-10T11:37:03.402806Z","title":"arXiv preprint arXiv:2506.10446 , year=","venue":"cs.CL","work_id":"e153fd26-2a21-4d09-94e5-4ad4496f8fbe","year":2025},"citing_paper":{"arxiv_id":"2607.08196","last_updated":"2026-07-09T07:54:39Z","snapshot_observed_at":"2026-08-07T00:25:36.849231Z","submitted_at":"2026-07-09T07:54:39Z","title":"A First-Principles Theory of Slow Thinking and Active Perception","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-07-10T11:32:24.374377Z"},"links":{"cited_paper":"/paper/2506.10446","citing_paper":"/paper/2607.08196"},"observation_digest":"sha256:7cc8564d73f18c0b1765d0e5cb3991f09233443b1ab110648d23f9371befb5ac","observation_id":"7aa84793-094d-4c27-bc20-0c9d0a2e9eed","resolution":{"observed_at":"2026-07-10T11:37:03.404461Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10446/citation-record","integrity":"/paper/2506.10446/integrity","json":"/paper/2506.10446/citation-record.json","paper":"/paper/2506.10446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.342069Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.342069Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:8f89a24abcf8a4ca29ad4526e43262fcad312a6631ff5bb04eb14823718fe94d","observation_id":"0069c815-bd16-4231-8173-7a5934c47051","resolution":{"observed_at":"2026-08-07T04:38:09.342069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.379807Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.379807Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:6fda2b2155a05fb8a3766f8d72dfc6c48b8d16d83a8cb5ebb17ed048fa901652","observation_id":"4980ab87-9059-4904-b725-1fbe1c83ae99","resolution":{"observed_at":"2026-08-07T04:38:09.379807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T04:38:09.444251Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.444251Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:9de966d7380ba151634b315ad8d424d54ae78c54f626a86114c82f6b8fd633e8","observation_id":"6aeaa226-188c-4a21-a082-b5543e7e2a48","resolution":{"observed_at":"2026-08-07T04:38:09.444251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T04:38:09.447873Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.447873Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:392bc45029f0b86c60942324d56892edce31ac488d3c83da9039fdf230d8dc55","observation_id":"3402a25a-1763-4e0c-a88b-a64da857ae46","resolution":{"observed_at":"2026-08-07T04:38:09.447873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T04:38:09.450960Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.450960Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:6749c483377cd103b8170dfbebda07ad8c1f8d9ce3fee295623241a2943ff407","observation_id":"908d5555-fa5d-4423-b0e8-8c01887fd963","resolution":{"observed_at":"2026-08-07T04:38:09.450960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.453792Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.453792Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:320e48dedaa41ab9452c352ca5126b02273766c7ed72002db2329cf336f143a1","observation_id":"b665ca90-4556-469d-b170-c5d81f76ea51","resolution":{"observed_at":"2026-08-07T04:38:09.453792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-08-13T03:17:19.241729Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-07T04:38:09.456278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.456278Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:c725e445fd8dcaf88aa35adb4fa4f5fbaeacba60631ebbf725aa1acba0ee290c","observation_id":"4c99523a-ece3-43b6-88ec-2b64a9fcaa15","resolution":{"observed_at":"2026-08-07T04:38:09.456278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T04:38:09.459181Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.459181Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:9ecddf8b7a1db26c4589eecaab2f0488a6bb0994c2d66753c410197988cb348b","observation_id":"7398259e-816c-4ee9-9ffa-ec0a5567b183","resolution":{"observed_at":"2026-08-07T04:38:09.459181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06580","last_updated":"2024-06-04T14:02:53Z","snapshot_observed_at":"2026-08-12T23:50:29.474572Z","submitted_at":"2024-06-04T14:02:53Z","title":"Break the Chain: Large Language Models Can be Shortcut Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06580","snapshot_observed_at":"2026-08-07T04:38:09.462021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.462021Z"},"links":{"cited_paper":"/paper/2406.06580","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:c357771802f17f0484b89268ede2f4802504363a37b0ef1a59b1479f25cb0862","observation_id":"9d3c70e8-74e4-4cf2-80e1-95f6f15f6072","resolution":{"observed_at":"2026-08-07T04:38:09.462021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17179","last_updated":"2024-02-09T00:13:46Z","snapshot_observed_at":"2026-08-11T02:32:39.494378Z","submitted_at":"2023-09-29T12:20:19Z","title":"Alphazero-like Tree-Search can Guide Large Language Model Decoding and Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17179","snapshot_observed_at":"2026-08-07T04:38:09.465060Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.465060Z"},"links":{"cited_paper":"/paper/2309.17179","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:7053c42d22ea4339ca5f547d821d8205a88cb1caf297f0e27bab2bcf9f12d432","observation_id":"e67df85b-d344-4f51-8833-ae66fee42643","resolution":{"observed_at":"2026-08-07T04:38:09.465060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T04:38:09.467858Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.467858Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:257508f4691a60c01fd6c54150964ed198ff962b219cf834eea52ee7235dbbad","observation_id":"d298be2c-dca1-4534-b93a-5f0ed09b9553","resolution":{"observed_at":"2026-08-07T04:38:09.467858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-11T04:38:08.656962Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-07T04:38:09.470606Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.470606Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:a60dc467163b5defd5eeb2f5fca18ab19466d100593a2173161db7f6ad311150","observation_id":"c883f271-b8c6-46de-be2f-abf7ad3f223f","resolution":{"observed_at":"2026-08-07T04:38:09.470606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T04:38:09.473281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.473281Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:1962c7c70e86b89db6544e179cd93e1805250ca21c16774a7e7168f9c3ad6046","observation_id":"f7de45b5-aa0c-48ee-85a2-47fc2c432ccc","resolution":{"observed_at":"2026-08-07T04:38:09.473281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.476241Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.476241Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:93c121ad2c9652b189b5034f3fdf2a5ba5912797475cc4bb2902501b11644697","observation_id":"95c9409d-08a4-436d-ab34-5940fff60271","resolution":{"observed_at":"2026-08-07T04:38:09.476241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01141","last_updated":"2025-04-01T00:41:36Z","snapshot_observed_at":"2026-08-08T04:02:43.828729Z","submitted_at":"2025-03-03T03:48:20Z","title":"How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01141","snapshot_observed_at":"2026-08-07T04:38:09.478670Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.478670Z"},"links":{"cited_paper":"/paper/2503.01141","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:272713e55f9818cfb8f49e07d56a9a57f2e92f5c55374ba76ba903ecc4ec8f7c","observation_id":"1effa212-a6a7-4461-8958-7e997de45ed1","resolution":{"observed_at":"2026-08-07T04:38:09.478670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.481397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.481397Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:b11f09eeac537207ee96ae69fdee1921f94e8cfc1b4bf81ea5ba504ab2c0e327","observation_id":"d1c23248-35b3-439c-91e7-dedaa67ed2da","resolution":{"observed_at":"2026-08-07T04:38:09.481397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01855","last_updated":"2024-11-04T07:10:24Z","snapshot_observed_at":"2026-08-12T22:08:33.082682Z","submitted_at":"2024-11-04T07:10:24Z","title":"Can Language Models Learn to Skip Steps?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01855","snapshot_observed_at":"2026-08-07T04:38:09.483737Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.483737Z"},"links":{"cited_paper":"/paper/2411.01855","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:037d01c9cfdf96a5e4217d3f20e0af325b0f9b085fc608e91f4f8025928bbac8","observation_id":"29ea50cc-b6d1-4a6c-8b6a-4dc85ddca9ab","resolution":{"observed_at":"2026-08-07T04:38:09.483737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T04:38:09.487029Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.487029Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:2992cab441937858949783d459ffae8f0e85c83729af1c52e37b09ebdd633a85","observation_id":"37e8aeb8-dd22-4af2-b8fc-8bd33ca73664","resolution":{"observed_at":"2026-08-07T04:38:09.487029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09601","last_updated":"2025-02-13T18:52:36Z","snapshot_observed_at":"2026-08-08T03:37:50.177168Z","submitted_at":"2025-02-13T18:52:36Z","title":"CoT-Valve: Length-Compressible Chain-of-Thought Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09601","snapshot_observed_at":"2026-08-07T04:38:09.490360Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.490360Z"},"links":{"cited_paper":"/paper/2502.09601","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:ca8a2aec4c6ad09684b9e6cda20d33ffcc32e4558e24516f0dbe8632847f379f","observation_id":"1e617a0c-4d1c-40c4-9b1c-089b198ab836","resolution":{"observed_at":"2026-08-07T04:38:09.490360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-07T04:38:09.493118Z","title":"Self-training elicits concise reasoning in large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.493118Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:8773f5b1aa76efc05d68e08f0adfcdc6726875ff925cee75a3749f6122f9b670","observation_id":"29ebbd21-de7d-44f0-b298-a49443504355","resolution":{"observed_at":"2026-08-07T04:38:09.493118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.921377Z","title":null,"venue":null,"work_id":"942a15d7-e314-42d0-8a8d-3f093d65e237","year":2021},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.495602Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:c9d2e45b6ef0002efd3a055b601e97dfe8055fd643501d06bdaf8669ce607901","observation_id":"fc246e1e-f44a-4d10-9d85-744785eb390a","resolution":{"observed_at":"2026-08-07T04:38:09.923839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.498219Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.498219Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:887b8be1e72a99f6e588e8e30ce64082bcf16e23d6b4c96646738c54c2ecdf86","observation_id":"ef1838da-9d3b-4dcc-b568-afde3d122de3","resolution":{"observed_at":"2026-08-07T04:38:09.498219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-10T14:40:38.654692Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T04:38:09.500490Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.500490Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:ab97aa75c55c9ad791aa929eb662ae97da362629cf573a9e283a7edb67ab44af","observation_id":"90e46486-f059-4c37-a975-434082a63560","resolution":{"observed_at":"2026-08-07T04:38:09.500490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T04:38:09.503183Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.503183Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:e74cba4f419c1fc4d9826797500097815edf598235b8f282bec36402ba27d330","observation_id":"1fd99e05-0f91-4449-858d-59837883ed03","resolution":{"observed_at":"2026-08-07T04:38:09.503183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T04:38:09.506458Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.506458Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:9f395d85619f5a7a324cff56eb30df004b1c7f06fcb99572c2cc020fbe0d1c21","observation_id":"5b5b2642-3fe4-4aff-9dc8-97c1a30d7232","resolution":{"observed_at":"2026-08-07T04:38:09.506458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-07T04:38:09.509078Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.509078Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:0b9696bdc2a46a7d41dedc4bb5046f401e7d02de54f4bbe18a74b76c952aaaf1","observation_id":"4479b550-e857-41f0-be56-da4d091dd45f","resolution":{"observed_at":"2026-08-07T04:38:09.509078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T04:38:09.511814Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.511814Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:da56cc83bf60b9924ee4116b97b95408782c5baaead125590c0646bddf0c97ca","observation_id":"35933934-069a-4963-bb2a-00c124f287a4","resolution":{"observed_at":"2026-08-07T04:38:09.511814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.912395Z","title":null,"venue":null,"work_id":"84258538-aaa7-4852-abc4-6871746328ad","year":2024},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.514686Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:101d84fcb717623ebc9f34b92b2ae54ffc36d2284726278c7daa65333347e217","observation_id":"00c920ab-74c4-4ebe-a797-247384b583c4","resolution":{"observed_at":"2026-08-07T04:38:09.915907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.516893Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.516893Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:d48a6e561d9a472fc3ae69f895f390cd6a0d4e08fd026bdfa4cd1d9e3738f1ab","observation_id":"0b57aabd-de9b-4a89-b2e8-dc5e9ad2cece","resolution":{"observed_at":"2026-08-07T04:38:09.516893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.519303Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.519303Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:8132a7f84358bd2d5f748ca25d62c00a837c60d062dc044b97864bb94a211a83","observation_id":"d873ba20-899e-44a3-a97c-bd6f33e6daff","resolution":{"observed_at":"2026-08-07T04:38:09.519303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.521675Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.521675Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:5cdb5d96ad06945b60c0b48987d20fe03346be07b06edce17fd1e6221da8322a","observation_id":"cebeac8f-9693-428e-a446-8303a767d6db","resolution":{"observed_at":"2026-08-07T04:38:09.521675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-08-07T17:49:06.764625Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-07T04:38:09.524298Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.524298Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:26be6068239f2b0c1834621a9b98d991cbea6a60f7e70fd132d31f9687ebe246","observation_id":"b38dbbbf-32d0-4f04-b678-3fbd2a42fdc2","resolution":{"observed_at":"2026-08-07T04:38:09.524298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:38:09.526904Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.526904Z"},"links":{"citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:460d769ddcbe2b17f75e88668a111dbfccd65ba432078a1e7fd1fbe1d0059833","observation_id":"51c8a539-fe39-48dc-9a2c-88b63d6ab88d","resolution":{"observed_at":"2026-08-07T04:38:09.526904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T04:38:09.529187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.529187Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:cd64784ade3621adf9152f453103f26154bc5e96e2a39271b217736aab857950","observation_id":"d12d43a8-1b04-49a0-86fe-b96238f7adae","resolution":{"observed_at":"2026-08-07T04:38:09.529187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T04:38:09.532937Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T04:38:09.532937Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2506.10446"},"observation_digest":"sha256:65b1583a223e11d58618e68a29e17c9b849e42cba5376401b471379a3de57799","observation_id":"c333e166-6cdc-4f61-8eb9-33e7b9cf86b2","resolution":{"observed_at":"2026-08-07T04:38:09.532937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10446","last_updated":"2025-06-12T07:49:24Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T14:59:18.671126Z","submitted_at":"2025-06-12T07:49:24Z","title":"Fast on the Easy, Deep on the Hard: Efficient Reasoning via Powered Length Penalty"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 11 inbound Pith citation observations for arXiv:2506.10446."}