{"as_of":"2026-08-21T09:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fad833df41701d28b5a91370fa618b1b82643ac70351e96d0669794da452a78","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:41:30.443487Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:54:17.656180Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.875028Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-05-14T01:29:56.480020Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2503.16419"},"observation_digest":"sha256:f638f12fa4dcb2ae3afc8b1425a27700071a84fb77b37c7d86fd86420c5d00ff","observation_id":"788f827d-c11a-4f5e-911b-d40096de2272","resolution":{"observed_at":"2026-05-14T01:29:56.823186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-08-06T17:54:17.656180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-20T12:31:43.651320Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.656180Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:229a4e538861b0d81a6c02c73e0ba2539fdc81c948be89f4e4179ba5ef9e6bf0","observation_id":"1a6a0e55-3b5f-4c3f-8143-3877a86ae2c4","resolution":{"observed_at":"2026-08-06T17:54:17.656180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.01111","last_updated":"2026-05-01T21:31:59Z","snapshot_observed_at":"2026-07-06T23:14:24.758147Z","submitted_at":"2026-05-01T21:31:59Z","title":"When Less is Enough: Efficient Inference via Collaborative Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:27:04.267404Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.01111"},"observation_digest":"sha256:03948be8697c7bf62563e5ecb419fde6c4c40dac74cfc16140dc5251ddae090d","observation_id":"8750ce5d-5a39-4973-b88c-f5a6ab0bb8e8","resolution":{"observed_at":"2026-05-11T15:41:43.015133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.06165","last_updated":"2026-05-07T12:51:49Z","snapshot_observed_at":"2026-08-17T00:27:13.360022Z","submitted_at":"2026-05-07T12:51:49Z","title":"Post Reasoning: Improving the Performance of Non-Thinking Models at No Cost","version":1},"reference_index":251,"source":"arxiv_source","source_observed_at":"2026-05-08T10:19:08.451445Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.06165"},"observation_digest":"sha256:6f06f2efebd592fc069a466a8ee665ddf9ed8ac35bc128c6eb0704cc2ef8e346","observation_id":"db530fcd-f20b-452a-a13e-c6bf8b302f72","resolution":{"observed_at":"2026-05-11T20:06:09.245378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2605.19358","last_updated":"2026-05-19T04:41:51Z","snapshot_observed_at":"2026-08-15T18:40:31.376425Z","submitted_at":"2026-05-19T04:41:51Z","title":"Taming the Thinker: Conditional Entropy Shaping for Adaptive LLM Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-20T06:40:06.103206Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2605.19358"},"observation_digest":"sha256:6bfcef8dc411b265b731d0e7aaed0389ddbee51bd391d2b0de10483eed480ee0","observation_id":"e7e74023-cbfa-40f8-bf5f-ce48eef83c14","resolution":{"observed_at":"2026-05-20T06:43:05.960803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-12T21:06:03.093786Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-26T16:15:22.543601Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:76dd5b7380a2662b8099a13cb25ee3ebc7c3dd4f14cf1396036f7aedaa0f130b","observation_id":"95d5fa2c-63b2-4dac-83bf-2b0e9d95bf91","resolution":{"observed_at":"2026-07-04T05:09:36.877011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-08-02T10:49:08.087657Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20295","last_updated":"2026-07-24T07:54:17Z","snapshot_observed_at":"2026-08-12T21:06:03.093786Z","submitted_at":"2026-06-18T14:33:09Z","title":"Token-Operations-Oriented Inference Optimization Techniques for Large Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-02T10:49:08.087657Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.20295"},"observation_digest":"sha256:20ee15c1b68789f6b819b59da5028f5a820679ef51a126df45bc74d75726561f","observation_id":"e6967e08-c3c8-4e23-8297-c4dd9a0ee001","resolution":{"observed_at":"2026-08-02T10:49:08.087657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.21178","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21178","snapshot_observed_at":"2026-07-04T09:19:43.875028Z","title":"arXiv preprint arXiv:2505.21178 , year=","venue":null,"work_id":"477c7905-5991-42c7-b30c-dfb20ee64d25","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-14T19:03:41.455654Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2505.21178","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:d78cc5b27de379dcccc637fb42aeaa60f8d0bb0bafdce97a5082ab5eee21ada7","observation_id":"d3634661-fae2-4be1-8448-6bce7fdca490","resolution":{"observed_at":"2026-07-04T09:19:43.876796Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21178/citation-record","integrity":"/paper/2505.21178/integrity","json":"/paper/2505.21178/citation-record.json","paper":"/paper/2505.21178"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.371918Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.371918Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:337fe6d750489a7e09c531582f844ced2335ddeb4deb4aa02c68b9c9ae01675e","observation_id":"b81ee456-0d52-4b5f-a579-962eb784e605","resolution":{"observed_at":"2026-08-07T13:41:28.371918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:41:28.479540Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.479540Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:518031e01d2220d387761e0e739a65590e282e29da7862d543bfd5149c504c95","observation_id":"12e31e88-5060-4b0a-8c26-a120743c7073","resolution":{"observed_at":"2026-08-07T13:41:28.479540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.585725Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.585725Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:425eca1996a15d87eada1c2ae0f4996688fe37148df342c4b5312e7a3a31c36f","observation_id":"1420f42f-046d-4d1e-b85f-f8012d519340","resolution":{"observed_at":"2026-08-07T13:41:28.585725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-08-19T11:46:55.171293Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:41:28.688241Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.688241Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:05cb9e0d0f3d4c448798704db905758540c7a7913392b07f3288b03e7e576c37","observation_id":"5b96ee8c-6b8d-4c54-86ce-3f52d171f55a","resolution":{"observed_at":"2026-08-07T13:41:28.688241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:41:28.743661Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.743661Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:7a271e49a9cc4a452f630c227b4a97ec7346ad7d6a8029a64787af1acc3353c3","observation_id":"33d1973f-f508-46ff-85b6-373f6c750ef6","resolution":{"observed_at":"2026-08-07T13:41:28.743661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.831623Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.831623Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:7d586c865761a4eb6ba6427f1e4aeb641830be1b090066570fc1b8b0e81423c8","observation_id":"1f177744-3d28-4f1c-aef2-1fe4e8ed9d75","resolution":{"observed_at":"2026-08-07T13:41:28.831623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:28.905630Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.905630Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:aebf09e4f527e92ac2c68cf034590963e421079738de56768c31aa4f708f8543","observation_id":"456363e9-8d2a-40f7-a591-f83ee6693c8b","resolution":{"observed_at":"2026-08-07T13:41:28.905630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:31.299343Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"4be580f7-8fc5-44c4-84b2-cc8e14be0059","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:28.965945Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:58f171a3bd4d66ee0c842757332b316aa202566005e7706fa3967dc6b9238b9a","observation_id":"86c3e0a8-97dc-42e0-a5bf-afd2471842bb","resolution":{"observed_at":"2026-08-07T13:41:31.410685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T13:41:29.061996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.061996Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:6bc87e7ad9149070c073fbeef1c3d0962592c3dc84739c585727ab1301706a7e","observation_id":"7f16d0e7-aa85-44dc-b555-33bb96a862db","resolution":{"observed_at":"2026-08-07T13:41:29.061996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.136896Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.136896Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:6dc25de55daca98798db70a5f08982b23cae3083b3229cf767cd6ab32f7ecb51","observation_id":"a9fd87bd-9edf-4305-8e57-5b10c52f7099","resolution":{"observed_at":"2026-08-07T13:41:29.136896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:31.063946Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models, 2025","venue":null,"work_id":"10751d96-5069-4d9f-8ed2-e220a82ad5f8","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.211992Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:bf0cfff5e28c58803bb42e38c438028e2bfb5489c526569cb6f2cdfcbd1285e6","observation_id":"5b103f33-1860-4f6d-b835-a1d09a3214f4","resolution":{"observed_at":"2026-08-07T13:41:31.164901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.309212Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.309212Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:6b07be77357d54feca46c52cbe14ced099c256db9cffd4a8de59da74f99cc8ec","observation_id":"5192dda7-3a17-4409-a2a3-95e4236bd339","resolution":{"observed_at":"2026-08-07T13:41:29.309212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T13:41:29.358576Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.358576Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:485ddb5c992b280d2c1ec50f152ea1a41a54dbfd8b3c482df1ce6609184dd3b7","observation_id":"14d24b52-b044-43cb-b105-0d52f8507a96","resolution":{"observed_at":"2026-08-07T13:41:29.358576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.407186Z","title":"Concise reasoning via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.407186Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:7aa1f2ae251e19cc582ebb605d7a48998b3d68f8067587f308920183823194ff","observation_id":"a511c874-76ae-4ea0-85d0-2e683ec10817","resolution":{"observed_at":"2026-08-07T13:41:29.407186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:41:29.485654Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.485654Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:b8d35e691b65caefe35d1f6e21611f2ad947838d9a9e96f6f4b87b613b43c7e0","observation_id":"268f1b66-93e5-483a-b060-83623e1f2a68","resolution":{"observed_at":"2026-08-07T13:41:29.485654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:41:29.558645Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.558645Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:e920c346ebe1b09332945379f10e012fc57a8ac24b216dd304698697643e2f0f","observation_id":"b78ba4d1-5f53-4b63-b769-b4ea1b998dac","resolution":{"observed_at":"2026-08-07T13:41:29.558645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.651369Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.651369Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:9d55546bbdeca129041aba06ed290f4fbc3b8b26de29a0537a7e8ab5c89c07e4","observation_id":"dd7c4d8d-a154-4858-b2e0-37ecac62f55f","resolution":{"observed_at":"2026-08-07T13:41:29.651369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T13:41:29.732447Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.732447Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:f13d8f06867b1ba4ddbd5a876b9e3a06484f1757d8ed704ac09301507e5efb5f","observation_id":"a8570983-096a-48d2-96c9-cb11b5ddd572","resolution":{"observed_at":"2026-08-07T13:41:29.732447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:29.811939Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.811939Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:ffa11e7a6958a8435c80b029ab5aa522477dac4da1bb3873d22397c96d7a57d6","observation_id":"d83cab6b-6cbc-47a6-89d8-dc83d447fa79","resolution":{"observed_at":"2026-08-07T13:41:29.811939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.865586Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility, 2025","venue":null,"work_id":"856e85b6-5c34-478f-91b0-19e2c09e4be4","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.893961Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:f609877487d2abe75c0a68ebad904ad2c9182cac38a20c11a50cda1517f29fe4","observation_id":"2ed5ca11-5da9-4e14-ae6c-686c2603a8b2","resolution":{"observed_at":"2026-08-07T13:41:30.939427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:41:29.958468Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.958468Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:0d57292bb2d791426dd0f394648d42b1476421235788f95c2ab37a3f8783fe02","observation_id":"0be12f3a-3998-48ae-b6c5-b0585ec4b4a6","resolution":{"observed_at":"2026-08-07T13:41:29.958468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.007684Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.007684Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:d4692d4d3e7be2b1ec3a97fa1eb985aaeee83244ed9fa5fab8278cd3ddb502e6","observation_id":"03ada641-80cc-400b-98b9-b340269b483c","resolution":{"observed_at":"2026-08-07T13:41:30.007684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-20T04:08:34.710482Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T13:41:30.046501Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.046501Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:06d749d10a9a6d783077f6565ac67f94dc85fb3ee6bcd28e97d5621fd138658e","observation_id":"267993ab-5ae7-41f0-9343-3a739f73831e","resolution":{"observed_at":"2026-08-07T13:41:30.046501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.127471Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.127471Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:f102301b1e1a2ee2b7a442ae0dbca16faf4f9b6fe5d237bce68dc0647709d3c8","observation_id":"d2a9d0b3-0b5e-4d55-9cc0-2409c6bff85d","resolution":{"observed_at":"2026-08-07T13:41:30.127471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.176429Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.176429Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:99bd82a19f6d888f28e8f6c4a9a6589c8dba06bbc0eeafaab364c6f34157ca5f","observation_id":"2f985c0f-0f15-43e3-9239-8d282d54aa74","resolution":{"observed_at":"2026-08-07T13:41:30.176429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.664520Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"b5edaca9-a83b-47c9-8527-1d1e1f5e46fe","year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.255652Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:caa44523e367368823baaf094bd509a6d28746ed6354c9da07dc111d51c367b6","observation_id":"dfa24d0c-3be8-487b-8067-7af43a5e905e","resolution":{"observed_at":"2026-08-07T13:41:30.761315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.317826Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.317826Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:ba383cf0d3752ae5b2472a4803665a834fcd279ca33c448d3a41caaf15b07ae4","observation_id":"21283f7c-89e6-4307-8f3e-8c67dc08414f","resolution":{"observed_at":"2026-08-07T13:41:30.317826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:41:30.382317Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.382317Z"},"links":{"citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:33b1ba07509b94b8d9ec231c56fe6b8824e7298e26b039577f2c8956f67d448c","observation_id":"166f3aa0-d6bd-4d93-93f9-12be5dd032c0","resolution":{"observed_at":"2026-08-07T13:41:30.382317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-20T04:23:28.056352Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T13:41:30.443487Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:30.443487Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:09dd133e1eab1fc142ebe0661344418f184acc1b642cd99c2354f71d0ab8abd7","observation_id":"a85ba105-22b8-4869-ad5a-b8688d9142cc","resolution":{"observed_at":"2026-08-07T13:41:30.443487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T19:24:53.799085Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 8 inbound Pith citation observations for arXiv:2505.21178."}