{"as_of":"2026-08-15T23:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:630d75c3b8e50e970ddbe1dfd719e49e0969bd02e12ad0757e060db1b1fdf428","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:52:27.870796Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:23:59.391394Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T05:13:58.683288Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.11827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all thoughts are gener- ated equal: Efficient llm reasoning via multi-turn reinforcement learning","venue":null,"work_id":"5bc33f44-2dc8-4096-89a4-dbf829632d17","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:35d7c9d248f6b891992c8b753e9c51ac48921bf9b4f215a60f729ec4c9175ec7","observation_id":"c49ac434-a5a7-4105-9e34-bfe3de753a62","resolution":{"observed_at":"2026-05-14T01:29:56.635307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-08-06T20:23:59.391394Z","title":"Not all thoughts are generated equal: Efficient llm reasoning via multi-turn reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02851","last_updated":"2025-07-03T17:55:43Z","snapshot_observed_at":"2026-08-11T03:20:33.235544Z","submitted_at":"2025-07-03T17:55:43Z","title":"MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:59.391394Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2507.02851"},"observation_digest":"sha256:6a600497b144ff983bd30e35aad9fbc6b2426536508033cbbc4cd119a915fb8d","observation_id":"54dd50c3-df24-42f5-b8f8-ec4744002cf9","resolution":{"observed_at":"2026-08-06T20:23:59.391394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-08-06T17:54:17.525716Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-15T08:55:38.744613Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.525716Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:bc85bba2c27f288c19bc0796ecd2088c892e73c33ed9b94e5295f20dcdb38405","observation_id":"8a4e6cdf-4396-4f8f-b656-829fb196fad7","resolution":{"observed_at":"2026-08-06T17:54:17.525716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-08-03T00:13:27.574670Z","title":"Not all thoughts are generated equal: Efficient llm reasoning via multi-turn reinforcement learning.arXiv preprint arXiv:2505.11827,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11351","last_updated":"2026-06-28T23:49:44Z","snapshot_observed_at":"2026-08-13T00:03:13.729408Z","submitted_at":"2026-02-11T20:40:43Z","title":"Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:13:27.574670Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2602.11351"},"observation_digest":"sha256:0de02ca95207b9a9d8b53bf826e709e2af3718ba5eb19efa5f1835275b498369","observation_id":"a8a8e0be-0c63-4936-a4fb-ca7f1444b804","resolution":{"observed_at":"2026-08-03T00:13:27.574670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.11827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all thoughts are gener- ated equal: Efficient llm reasoning via multi-turn reinforcement learning","venue":null,"work_id":"5bc33f44-2dc8-4096-89a4-dbf829632d17","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:4e2f571abe782d8652769511158e77407f84a87abf0b79d3fb4a7b8b23b97df6","observation_id":"58067f36-3c1b-4b8f-9e29-0b375f8f95b4","resolution":{"observed_at":"2026-05-11T20:06:09.128184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.11827","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all thoughts are gener- ated equal: Efficient llm reasoning via multi-turn reinforcement learning","venue":null,"work_id":"5bc33f44-2dc8-4096-89a4-dbf829632d17","year":2025},"citing_paper":{"arxiv_id":"2605.21260","last_updated":"2026-05-20T14:51:20Z","snapshot_observed_at":"2026-08-15T16:30:45.604285Z","submitted_at":"2026-05-20T14:51:20Z","title":"On the Cost and Benefit of Chain of Thought: A Learning-Theoretic Perspective","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-21T05:09:37.588841Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2605.21260"},"observation_digest":"sha256:9de0a2e66d43d96d1dfd056b758fb9c5b02b2c707d52b3895e2b3c9c5f5eaac9","observation_id":"2e4eb112-31b7-4a18-8ae7-d9998e1a7ce3","resolution":{"observed_at":"2026-05-21T05:13:58.685140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-08-06T17:07:01.503753Z","title":"Ong,I.;Almahairi,A.;Wu,V.;Chiang,W.-L.;Wu,T.;Gon- zalez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04771","last_updated":"2026-08-05T12:36:28Z","snapshot_observed_at":"2026-08-13T13:16:37.681988Z","submitted_at":"2026-08-05T12:36:28Z","title":"Fewer Tokens, Smaller Cache: Reward-Coordinated Efficient Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:01.503753Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2608.04771"},"observation_digest":"sha256:915bfbe249a87d5665557736aab416a5c112c98f5944177d9e19981ea6cf8ed2","observation_id":"59fc4700-df1c-4469-b7c4-14d4160378d4","resolution":{"observed_at":"2026-08-06T17:07:01.503753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11827","snapshot_observed_at":"2026-08-06T04:47:18.195206Z","title":"arXiv preprint arXiv:2505.11827 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05124","last_updated":"2026-08-05T17:50:08Z","snapshot_observed_at":"2026-08-10T07:44:29.028792Z","submitted_at":"2026-08-05T17:50:08Z","title":"Chained Recursive Language Models for Multi-Iteration Reasoning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:18.195206Z"},"links":{"cited_paper":"/paper/2505.11827","citing_paper":"/paper/2608.05124"},"observation_digest":"sha256:a7b948e42322c107656d3818a58c26ad4003c54f011c29e5330b5fd67d0768dd","observation_id":"0d5fba01-f539-49c5-bb77-0ff2e354f696","resolution":{"observed_at":"2026-08-06T04:47:18.195206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11827/citation-record","integrity":"/paper/2505.11827/integrity","json":"/paper/2505.11827/citation-record.json","paper":"/paper/2505.11827"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.845042Z","title":"Learning to reason with llms.https://openai.com/index/learnin g-to-reason-with-llms/, 2024","venue":null,"work_id":"a925c0d1-9dd9-41e6-a3b3-c6804bda7479","year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.634783Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:c67cffbe43d571c11e816711d98124e6f0c038f541abc8800bfc442bb56c7fc2","observation_id":"8e1dba22-f59a-42c0-bded-9c6f5d4bdb45","resolution":{"observed_at":"2026-08-15T20:52:28.848459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T20:52:27.639546Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.639546Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:113de3bb4fbde7339831308c4e5aca6297df39722e1b62d351c3baaefdd62efa","observation_id":"e3748f0a-bde4-4d82-9f1e-060c14ae6806","resolution":{"observed_at":"2026-08-15T20:52:27.639546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.644098Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.644098Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:dd4ad054d63d2edb30f24fab051adb7340f736bad48d26a8dbaeb0ee1c15280a","observation_id":"27ac5935-22e6-42db-bdd7-5244f26444ca","resolution":{"observed_at":"2026-08-15T20:52:27.644098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.647305Z","title":"Introducing openai o1.https://openai.com/o1/, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.647305Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:f66ff2278d5abd42ea1fe299f96606cd9ddaa46877a23b28fbe3274cdb8886d9","observation_id":"a8f5373e-6d3d-4440-aa18-d314bbfad2f4","resolution":{"observed_at":"2026-08-15T20:52:27.647305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:52:27.650871Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.650871Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:fd5f94ec56e773e37195308167a6dc3712f29b97cf8cdbfab694b1aa6ecbf608","observation_id":"6b5cfc72-4287-4bcf-b555-5bd139d88c34","resolution":{"observed_at":"2026-08-15T20:52:27.650871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-13T09:04:30.125777Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-15T20:52:27.658521Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.658521Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:2d20fe44b26540c594e86cb9cbc0ed5066dd51c8c6362a4421b6fa9790b39d42","observation_id":"e2fc4f2a-5bb0-4c20-bbf8-728a31a1a393","resolution":{"observed_at":"2026-08-15T20:52:27.658521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.661450Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.661450Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:1842bb888486735590db048efaf9741cfa2041910781e51a870959fb07bf155c","observation_id":"2b157013-fddc-4f84-9a4a-d1d1a375fd2b","resolution":{"observed_at":"2026-08-15T20:52:27.661450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04925","last_updated":"2024-06-22T08:18:48Z","snapshot_observed_at":"2026-08-15T17:59:06.973877Z","submitted_at":"2024-01-10T04:37:38Z","title":"The Impact of Reasoning Step Length on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04925","snapshot_observed_at":"2026-08-15T20:52:27.664401Z","title":"The impact of reasoning step length on large language models.arXiv preprint arXiv:2401.04925, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.664401Z"},"links":{"cited_paper":"/paper/2401.04925","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:95adfb2193b705d15dca4d7c13557605658d844ac648162a2989c57c4c84d96d","observation_id":"2a969319-8f2c-4325-9f57-8bbdac892614","resolution":{"observed_at":"2026-08-15T20:52:27.664401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13171","last_updated":"2024-12-17T18:50:33Z","snapshot_observed_at":"2026-08-13T23:47:35.674752Z","submitted_at":"2024-12-17T18:50:33Z","title":"Compressed Chain of Thought: Efficient Reasoning Through Dense Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13171","snapshot_observed_at":"2026-08-15T20:52:27.668099Z","title":"Compressed chain of thought: Efficient reasoning through dense representations.arXiv preprint arXiv:2412.13171, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.668099Z"},"links":{"cited_paper":"/paper/2412.13171","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:b6464b56c92b4dd50395872ccd9dd47a4012b69a06d717abeebb5bf825892d92","observation_id":"31fb7393-e939-4dbd-883a-4a878431eb63","resolution":{"observed_at":"2026-08-15T20:52:27.668099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-08-07T17:49:06.764625Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-15T20:52:27.671402Z","title":"Chain of draft: Thinking faster by writing less","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.671402Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:b3630a2f6ddaea85be35353509fdc54c917c9a6844cc4e071e318907b5d93cd7","observation_id":"25566f2e-0ee5-481c-a220-65747c2038a9","resolution":{"observed_at":"2026-08-15T20:52:27.671402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.819142Z","title":"Overthink: Slowdown attacks on reasoning llms.arXiv e-prints, pages arXiv–2502, 2025","venue":null,"work_id":"4324422e-3614-4642-81bb-9ddc86355b89","year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.675031Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:0bf627f975d104da15672c2473ae278df39ef1d7eb3f96feccecca8c3ec48abc","observation_id":"2f4ef41c-fd30-4d41-9521-3e5d656545dd","resolution":{"observed_at":"2026-08-15T20:52:28.822616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-13T10:37:12.511011Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-15T20:52:27.677819Z","title":"Token-budget- aware llm reasoning.arXiv preprint arXiv:2412.18547, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.677819Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:7c0bc47ba5960333e009ae200d64e4eea8c79293886d0f6d4039077be90f3cd4","observation_id":"f0b5292a-738b-42b2-8c1a-a7f835de7063","resolution":{"observed_at":"2026-08-15T20:52:27.677819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.809529Z","title":"Qwen3 technical report.https://github.com/QwenLM/Qwen3, 2025","venue":null,"work_id":"ae8ebb37-f5cd-45cc-a93d-7973af3a00b7","year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.682141Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:6f62e9c0444e4ef02ebc51c64be9ccb961506659d75753ff9535d0a80f1a296f","observation_id":"5b5bd5a4-9389-41e0-8ac2-56201a426bb3","resolution":{"observed_at":"2026-08-15T20:52:28.812993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-15T20:52:27.685481Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.685481Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:afc27da7e85ac9e33e6be88aa55ab72a42d139f4f7486530cea7809524055a8d","observation_id":"e908915e-3fa1-4ce7-bbad-d0357e9bf397","resolution":{"observed_at":"2026-08-15T20:52:27.685481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02875","last_updated":"2025-03-04T18:56:03Z","snapshot_observed_at":"2026-08-13T23:55:49.103288Z","submitted_at":"2025-03-04T18:56:03Z","title":"The First Few Tokens Are All You Need: An Efficient and Effective Unsupervised Prefix Fine-Tuning Method for Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02875","snapshot_observed_at":"2026-08-15T20:52:27.688704Z","title":"The first few tokens are all you need: An efficient and effective unsupervised prefix fine-tuning method for reasoning models.arXiv preprint arXiv:2503.02875, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.688704Z"},"links":{"cited_paper":"/paper/2503.02875","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:bc539e6cf00e3a5a434c5b928c9e47b604556f6b4b8e6c2208a2a1e96da43551","observation_id":"2afa4310-dec1-4d01-a029-46e5ef2e3580","resolution":{"observed_at":"2026-08-15T20:52:27.688704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.692641Z","title":"C3ot: Generating shorter chain-of-thought without compromising effectiveness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.692641Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:4546bb474e0b563a5da9636365492c4c6646186be3abb9469bda9d6f9bb68fc2","observation_id":"850607b7-d2b6-4c07-9949-2d3547d9615a","resolution":{"observed_at":"2026-08-15T20:52:27.692641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11157","last_updated":"2025-02-16T15:11:19Z","snapshot_observed_at":"2026-08-07T18:14:40.308201Z","submitted_at":"2025-02-16T15:11:19Z","title":"Dyve: Thinking Fast and Slow for Dynamic Process Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11157","snapshot_observed_at":"2026-08-15T20:52:27.695931Z","title":"Dyve: Thinking fast and slow for dynamic process verification.arXiv preprint arXiv:2502.11157, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.695931Z"},"links":{"cited_paper":"/paper/2502.11157","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:871a9adb3e8f6ebc564d8601ab9546886da2543280886acbae60bfc8ea0d9687","observation_id":"a84781a2-bf34-4873-9b11-d09c97742971","resolution":{"observed_at":"2026-08-15T20:52:27.695931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-15T20:52:27.699687Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning.arXiv preprint arXiv:2501.12570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.699687Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:c1bc653c0da26e232236d5a280d4a488a2f850bc2855da43239e61afca9e38d5","observation_id":"e6b09a1b-1fa5-48db-bfb0-559bfab9b492","resolution":{"observed_at":"2026-08-15T20:52:27.699687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.704228Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.704228Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:01f9a5f817b4c80dc365fe5cfe81916416f097f4ac5d4ea5a0622d6d3696e4fa","observation_id":"e6ff6136-31eb-4de6-ad29-1eb61a5528b7","resolution":{"observed_at":"2026-08-15T20:52:27.704228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.794691Z","title":"Online and offline reinforcement learning by planning with a learned model.Advances in Neural Information Processing Systems, 34:27580–27591, 2021","venue":null,"work_id":"f2a62c1a-a7c4-458a-b6e3-d825c5525a7c","year":2021},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.707191Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:587f8199a51e167b0cbd6040122a248505db41ab9dec4b404573460b98907fbb","observation_id":"b20208bc-ead9-42da-a680-41fd3a7d5472","resolution":{"observed_at":"2026-08-15T20:52:28.798121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.710089Z","title":"Dast: Difficulty-adaptive slow-thinking for large reasoning models.arXiv preprint arXiv:2503.04472, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.710089Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:5bb8b649e270183fda040489dd8962cf282bd931c8d3c8ad5138cbca0c351a79","observation_id":"985d6bf2-2a28-42a4-89c4-d0e65b46cbf0","resolution":{"observed_at":"2026-08-15T20:52:27.710089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.713053Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.713053Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:e63e4d43ec2fde9ace438d7964577c575f716a22f4adfa8a877a3b7076a5cccc","observation_id":"edff6d17-bcb0-4dca-a2d2-fb029ef536d1","resolution":{"observed_at":"2026-08-15T20:52:27.713053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.715892Z","title":"Training language models to reason efficiently.arXiv preprint arXiv:2502.04463, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.715892Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:a3c10794f134e86e3480fb11ab1e061a778f9fdbbc33db686769b33a597b6319","observation_id":"a1be2436-b5c5-4c4e-9c5c-4d84596db1d3","resolution":{"observed_at":"2026-08-15T20:52:27.715892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-15T20:52:27.719429Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.719429Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:f5d8b08cc9dc16ceab960023aa5cb900fea694f6a7168d0e491b53d7e3b0a91b","observation_id":"5986889f-1302-414a-ade3-7b66de653f7e","resolution":{"observed_at":"2026-08-15T20:52:27.719429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-15T20:52:27.723462Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.723462Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:be47f02c3f9644eb0efee5dd0788f870844c75d1e4dfbcdaac39ccaa42848b9f","observation_id":"fadac48b-a9aa-41f3-8f7c-219aef7d1526","resolution":{"observed_at":"2026-08-15T20:52:27.723462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06772","last_updated":"2025-03-11T02:46:19Z","snapshot_observed_at":"2026-08-12T03:51:31.598735Z","submitted_at":"2025-02-10T18:51:47Z","title":"ReasonFlux: Hierarchical LLM Reasoning via Scaling Thought Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06772","snapshot_observed_at":"2026-08-15T20:52:27.726983Z","title":"Reasonflux: Hierarchical llm reasoning via scaling thought templates.arXiv preprint arXiv:2502.06772, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.726983Z"},"links":{"cited_paper":"/paper/2502.06772","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:4c498185bd05742b32a19a58f05c5d0b62d410d76197e26fb1046701467f4625","observation_id":"4ba20099-7780-449f-806b-b73a8ac4f8cd","resolution":{"observed_at":"2026-08-15T20:52:27.726983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-07T17:09:42.953110Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-08-15T20:52:27.730903Z","title":"Rema: Learning to meta-think for llms with multi-agent reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.730903Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:97d970fef2e5b7584d8ba8406637f31905d1fba18f85037f17b2336abbf3922f","observation_id":"a40e80ad-2282-480d-8db0-e3cef605a3e0","resolution":{"observed_at":"2026-08-15T20:52:27.730903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.733962Z","title":"Sketch-of-thought: Efficient llm reasoning with adaptive cognitive-inspired sketching.arXiv preprint arXiv:2503.05179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.733962Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:8ddd9c21d42041d7781778b49ed83d4afbd9daccb5d3279036a8d7cabbf0eed8","observation_id":"765784a6-0dc0-4231-97e6-dbc6a8b6d504","resolution":{"observed_at":"2026-08-15T20:52:27.733962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04383","last_updated":"2025-04-15T14:07:31Z","snapshot_observed_at":"2026-08-10T20:21:55.932155Z","submitted_at":"2025-04-06T06:23:27Z","title":"Retro-Search: Exploring Untaken Paths for Deeper and Efficient Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04383","snapshot_observed_at":"2026-08-15T20:52:27.736820Z","title":"Retro-search: Exploring untaken paths for deeper and efficient reasoning.arXiv preprint arXiv:2504.04383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.736820Z"},"links":{"cited_paper":"/paper/2504.04383","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:ebc9d2d36ca97b0bbc9e18e4ebc829c183c7d7b0b85b26734cebfc506ada0908","observation_id":"e477dc24-4d10-4354-9d19-a314b218a1cd","resolution":{"observed_at":"2026-08-15T20:52:27.736820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14655","last_updated":"2024-12-02T12:37:46Z","snapshot_observed_at":"2026-08-12T23:59:45.002198Z","submitted_at":"2024-05-23T14:53:54Z","title":"Multi-turn Reinforcement Learning from Preference Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14655","snapshot_observed_at":"2026-08-15T20:52:27.740448Z","title":"Multi-turn reinforcement learning from preference human feedback.arXiv preprint arXiv:2405.14655, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.740448Z"},"links":{"cited_paper":"/paper/2405.14655","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:81906a1909352978b6389ff8cb96d5211b003f5a92f2fc3e9bb72113fb540f78","observation_id":"502911ea-43e2-4047-8336-6c8b367e5000","resolution":{"observed_at":"2026-08-15T20:52:27.740448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15478","last_updated":"2025-03-19T17:55:08Z","snapshot_observed_at":"2026-08-08T21:39:18.091217Z","submitted_at":"2025-03-19T17:55:08Z","title":"SWEET-RL: Training Multi-Turn LLM Agents on Collaborative Reasoning Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15478","snapshot_observed_at":"2026-08-15T20:52:27.744073Z","title":"Sweet-rl: Training multi-turn llm agents on collaborative reasoning tasks.arXiv preprint arXiv:2503.15478, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.744073Z"},"links":{"cited_paper":"/paper/2503.15478","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:2a17f8d2dedf8adf186edbecdb778fa52e2311bc1be1492d91b5fba055958066","observation_id":"4ce1d644-c834-4bdc-b210-d44b430e6f02","resolution":{"observed_at":"2026-08-15T20:52:27.744073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-15T20:52:27.747468Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning.arXiv preprint arXiv:2503.09516, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.747468Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:24a56bb4d11818f32f0c98563131e2cbeb5769cc80bc9b2c8f4b1d1facaf37f8","observation_id":"31efee27-1b1e-43ca-9bb5-bd2bc54ce65f","resolution":{"observed_at":"2026-08-15T20:52:27.747468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02956","last_updated":"2025-04-03T18:22:20Z","snapshot_observed_at":"2026-08-09T23:33:43.014307Z","submitted_at":"2025-04-03T18:22:20Z","title":"Understanding Aha Moments: from External Observations to Internal Mechanisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02956","snapshot_observed_at":"2026-08-15T20:52:27.751482Z","title":"Understanding aha moments: from external observations to internal mechanisms.arXiv preprint arXiv:2504.02956, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.751482Z"},"links":{"cited_paper":"/paper/2504.02956","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:23df9350b77fed1dce48d5f8cf7ae901be90c6a5976d9beb91a558043d5a9333","observation_id":"ed3566b4-85de-4e3d-af50-03f48fbbac4f","resolution":{"observed_at":"2026-08-15T20:52:27.751482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.779286Z","title":"A mean value theorem in geometry of numbers.Annals of Mathematics, 46(2):340– 347, 1945","venue":null,"work_id":"6adb9537-1284-44f4-8085-7886b2b7190f","year":1945},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.754781Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:7f43ab7f4a473443b12a5437350c460d3dc6666908acc8e399aa0b0fcab06539","observation_id":"47b0b348-7b01-4df4-930f-59b4a7fc3cb2","resolution":{"observed_at":"2026-08-15T20:52:28.782955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09782","last_updated":"2024-06-06T13:22:26Z","snapshot_observed_at":"2026-08-14T18:20:42.263331Z","submitted_at":"2023-06-16T11:37:15Z","title":"Full Parameter Fine-tuning for Large Language Models with Limited Resources","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09782","snapshot_observed_at":"2026-08-15T20:52:27.758311Z","title":"Full parameter fine-tuning for large language models with limited resources.arXiv preprint arXiv:2306.09782, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.758311Z"},"links":{"cited_paper":"/paper/2306.09782","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:64552a47d9766b7d4c11ad6eae1244d81a80aed2caab720724d9dda0061b7abd","observation_id":"fca55852-c6bc-4c30-9094-c5cea4f1f8cc","resolution":{"observed_at":"2026-08-15T20:52:27.758311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.762022Z","title":"Group robust preference optimization in reward-free rlhf.Advances in Neural Information Processing Systems, 37:37100–37137, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.762022Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:7a139990f47dc871c9645411ae0abcab52498e8a02b0533434237cb140f4ba3c","observation_id":"abb78ab0-561d-4ed0-9d23-7cb9bea99dd7","resolution":{"observed_at":"2026-08-15T20:52:27.762022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:52:27.765050Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.765050Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:37e3d3864f967dabac403886c8448ac73a4ce084ca4cf58c4cdeb4298a632aa6","observation_id":"27b61284-ff46-400b-9713-7e947da215eb","resolution":{"observed_at":"2026-08-15T20:52:27.765050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T20:52:27.767942Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.767942Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:ad95ddbb22052c9293c65f1c7401e4d4f3d079241152a0b533c8f17aa7dcb706","observation_id":"520ef70c-bec0-4975-9246-5a424b32a98e","resolution":{"observed_at":"2026-08-15T20:52:27.767942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-15T20:52:27.771802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.771802Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:c653f3c5d0e662e025b52a187ec3c4dd35e9e7d8510aab69e2d577cb9ca8213e","observation_id":"618aa3ef-6adc-4710-ada4-e97572a50cee","resolution":{"observed_at":"2026-08-15T20:52:27.771802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.762642Z","title":"Aime problems and solutions.https://artofproblemsolving.com/wiki/ index.php, 2025","venue":null,"work_id":"a34bf781-99d7-454d-99ca-659f76098c34","year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.775555Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:5d0564f40083f7eb9cd06167a319ef7ed4a3d49c7057daf1068d769ed8015138","observation_id":"7a23f9d3-94b7-438e-99dc-eb19b18c3fdb","resolution":{"observed_at":"2026-08-15T20:52:28.766318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:28.751344Z","title":"American mathematics competitions","venue":null,"work_id":"62c8dfba-4f5c-459d-a259-24e18167176e","year":2023},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.778876Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:4afc90a1f946a764872a3c9dc9d924688d20addc12f86597688cea49af1c6667","observation_id":"dee9d6e8-c74d-48fe-9103-8c312fea37f6","resolution":{"observed_at":"2026-08-15T20:52:28.755841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.782764Z","title":"Openmathinstruct-1: A 1.8 million math instruction tuning dataset.Advances in Neural Information Processing Systems, 37:34737–34774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.782764Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:3264e67945ac53ba46db2891e6b44948e66e69deabe9b73ddd5e3e9ac60f96d0","observation_id":"655a4ab2-74dc-46d4-90db-9e1180f84fa4","resolution":{"observed_at":"2026-08-15T20:52:27.782764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-15T20:52:27.786159Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.786159Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:9748f125587b15010eb2c345a470225ae650ef1339ea07c1c6a98b84097a1540","observation_id":"4fe5c724-7d25-45a1-8fee-a2e28a7f8623","resolution":{"observed_at":"2026-08-15T20:52:27.786159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-13T14:42:27.278298Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-15T20:52:27.789583Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning.arXiv preprint arXiv:2504.01296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.789583Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:ff9de9b2495e00fcd3d479c301a8a84d69fa86dab5e3414c90da33dfb425177c","observation_id":"e802468b-9b07-4702-be93-1e2a8ccf773c","resolution":{"observed_at":"2026-08-15T20:52:27.789583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04519","last_updated":"2025-01-08T14:12:57Z","snapshot_observed_at":"2026-08-14T00:11:28.443916Z","submitted_at":"2025-01-08T14:12:57Z","title":"rStar-Math: Small LLMs Can Master Math Reasoning with Self-Evolved Deep Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04519","snapshot_observed_at":"2026-08-15T20:52:27.792807Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking.arXiv preprint arXiv:2501.04519, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.792807Z"},"links":{"cited_paper":"/paper/2501.04519","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:c307db09e789234ab809e3efc6a4e665fbd1b2cf588dcafadcace542a1150e62","observation_id":"94b89a96-f547-4572-aef0-f4973a882a20","resolution":{"observed_at":"2026-08-15T20:52:27.792807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-15T20:52:27.796197Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.796197Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:0ccdc2ed48171ee83b30235466e8d9da7c25461885be266819f5a5322411681a","observation_id":"14214f1d-8fa2-486a-afaf-38116cfeba96","resolution":{"observed_at":"2026-08-15T20:52:27.796197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.799680Z","title":"Reinforcement learning: A survey","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.799680Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:a06f6a213876347a5c403b848b331951a9a49d3845ba04db191a9209a81712d8","observation_id":"574eb0f7-8cee-4c95-a05d-36c3acc8843f","resolution":{"observed_at":"2026-08-15T20:52:27.799680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.803424Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.803424Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:7aa6fd2a1de11bb4b15e4e1dd04aef14b52dfc218c90fd402335edd48083af2e","observation_id":"be1a0a3a-9cd3-4480-9401-8af1e76688a9","resolution":{"observed_at":"2026-08-15T20:52:27.803424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:52:27.806763Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.806763Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:2bcbe53b9392360751b8c6feca06db7c72d581f455bc0979e09febe324e2b1cd","observation_id":"46f35f72-7e74-4449-ab0f-915e23473538","resolution":{"observed_at":"2026-08-15T20:52:27.806763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.809993Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.809993Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:2b5180e45e70d0380015138e814ff2af83026dc61adfe719eec1a46c75ca3216","observation_id":"395f7013-2ea5-4df3-b813-2eeebbd629cf","resolution":{"observed_at":"2026-08-15T20:52:27.809993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-15T20:52:27.812991Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback.arXiv preprint arXiv:2307.15217, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.812991Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:e83edc00ea4e4d61474a8e0bfa08b6e5e40e6939abd0697c247b04cf5b2686aa","observation_id":"184f5881-91fc-48fc-b1d4-f8fefd141967","resolution":{"observed_at":"2026-08-15T20:52:27.812991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-08-15T04:58:53.543603Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-15T20:52:27.816985Z","title":"Toolrl: Reward is all tool learning needs.arXiv preprint arXiv:2504.13958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.816985Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:75de0edb9bb7954ccbaf234b8285596db862c213dc4b2ee9f0013f856abed809","observation_id":"1742f3de-8276-4f9c-be08-59518fb6d091","resolution":{"observed_at":"2026-08-15T20:52:27.816985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-15T20:52:27.820470Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.820470Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:b1dc3bb6c9d77023b809f6dcfa3ac969a16b17508bca0f52c24ad71603ac1cbc","observation_id":"78f1c130-c44c-48b9-871e-a2aeea3c6cb7","resolution":{"observed_at":"2026-08-15T20:52:27.820470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01141","last_updated":"2025-04-01T00:41:36Z","snapshot_observed_at":"2026-08-08T04:02:43.828729Z","submitted_at":"2025-03-03T03:48:20Z","title":"How Well do LLMs Compress Their Own Chain-of-Thought? A Token Complexity Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01141","snapshot_observed_at":"2026-08-15T20:52:27.824350Z","title":"How well do llms compress their own chain-of-thought? a token complexity approach.arXiv preprint arXiv:2503.01141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.824350Z"},"links":{"cited_paper":"/paper/2503.01141","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:a8844ac2f8d41f3ce72a9ede08b57cc650d9a3e0fc9265c7ba10735d9e2edcb7","observation_id":"776fd629-9eb6-44f0-b51e-a5c6e1992dcb","resolution":{"observed_at":"2026-08-15T20:52:27.824350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17974","last_updated":"2025-01-31T16:06:26Z","snapshot_observed_at":"2026-08-10T04:24:13.330305Z","submitted_at":"2025-01-29T20:20:48Z","title":"Think Smarter not Harder: Adaptive Reasoning with Inference Aware Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17974","snapshot_observed_at":"2026-08-15T20:52:27.827471Z","title":"Think smarter not harder: Adaptive reasoning with inference aware optimization.arXiv preprint arXiv:2501.17974, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.827471Z"},"links":{"cited_paper":"/paper/2501.17974","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:3e011aa5524d36dc3c38a11e02adb7641dafcb8bdda2d9e8af71e43733798f35","observation_id":"b7a02d69-6fa8-43ed-8bc6-e8f34317e1b0","resolution":{"observed_at":"2026-08-15T20:52:27.827471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-15T12:50:14.757118Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-15T20:52:27.831037Z","title":"When more is less: Understanding chain-of-thought length in llms.arXiv preprint arXiv:2502.07266, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.831037Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:8b01fa05c3e6b3bd2014ca48cb7676ab2b57167f731a533f7a361493fea7267c","observation_id":"b3d3519c-2fec-46b2-87f7-24724493797f","resolution":{"observed_at":"2026-08-15T20:52:27.831037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19918","last_updated":"2026-05-07T16:58:35Z","snapshot_observed_at":"2026-08-02T05:40:27.766263Z","submitted_at":"2025-02-27T09:40:13Z","title":"Meta-Reasoner: Dynamic Guidance for Optimized Inference-time Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19918","snapshot_observed_at":"2026-08-15T20:52:27.835260Z","title":"Meta-reasoner: Dynamic guidance for optimized inference-time reasoning in large language models.arXiv preprint arXiv:2502.19918, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.835260Z"},"links":{"cited_paper":"/paper/2502.19918","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:e7fe8c9043014005db568aaff4551aa1438748847af80d487ca74e7cb5268adc","observation_id":"7dd76593-d63d-450b-9f2d-31865105f96f","resolution":{"observed_at":"2026-08-15T20:52:27.835260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.838341Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning.arXiv preprint arXiv:2502.18080, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.838341Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:085b2686ff577470697479a0eebf79912b83ec10369975c172f41e85e18167d7","observation_id":"c9c5322d-43cd-4113-a0bf-1b7508694eb1","resolution":{"observed_at":"2026-08-15T20:52:27.838341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09601","last_updated":"2025-02-13T18:52:36Z","snapshot_observed_at":"2026-08-15T01:40:51.444222Z","submitted_at":"2025-02-13T18:52:36Z","title":"CoT-Valve: Length-Compressible Chain-of-Thought Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09601","snapshot_observed_at":"2026-08-15T20:52:27.842063Z","title":"Cot-valve: Length- compressible chain-of-thought tuning.arXiv preprint arXiv:2502.09601, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.842063Z"},"links":{"cited_paper":"/paper/2502.09601","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:1e2b17bce963c969bb3b6defe6e7de9963829a971489db08da2abef65e645c7d","observation_id":"d8b39363-d6ff-43eb-87ea-418ba1404c9a","resolution":{"observed_at":"2026-08-15T20:52:27.842063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21074","last_updated":"2025-09-23T08:16:08Z","snapshot_observed_at":"2026-08-07T17:46:47.440455Z","submitted_at":"2025-02-28T14:07:48Z","title":"CODI: Compressing Chain-of-Thought into Continuous Space via Self-Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21074","snapshot_observed_at":"2026-08-15T20:52:27.845785Z","title":"Codi: Compressing chain-of-thought into continuous space via self-distillation.arXiv preprint arXiv:2502.21074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.845785Z"},"links":{"cited_paper":"/paper/2502.21074","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:79a7bfc79c619017ab70a15f787d4bddad6835599cc6a70cff28deb3e021c0b9","observation_id":"48c433c0-bc47-4fd9-a618-9f009a0397f4","resolution":{"observed_at":"2026-08-15T20:52:27.845785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-15T20:52:27.849593Z","title":"Self-training elicits concise reasoning in large language models.arXiv preprint arXiv:2502.20122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.849593Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:f1205d41749d00a391609ef25adf8732986e04923e4bfe19ea93673829f8bbd2","observation_id":"109476f8-8def-475d-9ffb-b1d75da5e7c9","resolution":{"observed_at":"2026-08-15T20:52:27.849593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-15T20:52:27.853828Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms.arXiv preprint arXiv:2412.21187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.853828Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:b4d5cdd3dba2742a72932b308964799f4b657d1b5b4d16f21225ea2af0c60a41","observation_id":"cca3f5df-7e8b-40bf-bd8f-0156febd332b","resolution":{"observed_at":"2026-08-15T20:52:27.853828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13260","last_updated":"2025-02-18T20:04:51Z","snapshot_observed_at":"2026-08-10T14:15:50.668871Z","submitted_at":"2025-02-18T20:04:51Z","title":"Stepwise Perplexity-Guided Refinement for Efficient Chain-of-Thought Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13260","snapshot_observed_at":"2026-08-15T20:52:27.856904Z","title":"Stepwise perplexity-guided refinement for efficient chain-of-thought reasoning in large language models.arXiv preprint arXiv:2502.13260, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.856904Z"},"links":{"cited_paper":"/paper/2502.13260","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:628c39189329e974face843fad2eb2603f35b0a216dcf3e21393340487549206","observation_id":"a821dc8e-b968-4b71-a921-b53b2085702b","resolution":{"observed_at":"2026-08-15T20:52:27.856904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.860411Z","title":"Lightthinker: Thinking step-by-step compression.arXiv preprint arXiv:2502.15589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.860411Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:8e3dbb3857424868aaae7c3ab9466acfe807c7bd5ede1d22cd64d86bb20c6333","observation_id":"816da435-fdff-4de7-b8de-eb6a2dda2275","resolution":{"observed_at":"2026-08-15T20:52:27.860411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.864055Z","title":"Inftythink: Breaking the length limits of long-context reasoning in large language models.arXiv preprint arXiv:2503.06692, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.864055Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:80fa2f7ae8e09da22f332d1e1b2a7189b5b4ef6464c5e90e0d3db32b0274e9ac","observation_id":"12f1b8f7-0988-4533-ad2e-a02915e295c3","resolution":{"observed_at":"2026-08-15T20:52:27.864055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-15T06:09:25.789897Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T20:52:27.866978Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.866978Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:722134beee61a4a001e2938a91c6583582d32a4d8885ac8cc0d316337cdc9b60","observation_id":"a9e3d244-2771-4265-97ee-a3044ef22b02","resolution":{"observed_at":"2026-08-15T20:52:27.866978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:52:27.870796Z","title":"Given that47−1≡51 (mod 97) , find 28−1 (mod 97), as a residue modulo 97. (Give a number between 0 and 96, inclusive.)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:52:27.870796Z"},"links":{"citing_paper":"/paper/2505.11827"},"observation_digest":"sha256:fe2ca5607983924f19245d5c945abaa402cf0fb88c00b6f6b305800ee860db14","observation_id":"0f0da7bb-d5dc-4627-a65f-8716e3b0cd23","resolution":{"observed_at":"2026-08-15T20:52:27.870796Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11827","last_updated":"2025-05-25T04:09:29Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T20:44:40.659527Z","submitted_at":"2025-05-17T04:26:39Z","title":"Not All Thoughts are Generated Equal: Efficient LLM Reasoning via Multi-Turn Reinforcement Learning"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 8 inbound Pith citation observations for arXiv:2505.11827."}