{"as_of":"2026-08-11T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:333362496d0b028724e37f5207fe1c12ce3a88ebc6a737584260a737363b5835","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:38:47.682695Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:09:39.636062Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:46:20.251611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-06T12:09:39.636062Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22037","last_updated":"2025-07-29T17:39:48Z","snapshot_observed_at":"2026-08-09T21:34:44.464339Z","submitted_at":"2025-07-29T17:39:48Z","title":"Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:39.636062Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2507.22037"},"observation_digest":"sha256:fcbb9f6b2393748f537618aabd824aadd0f39ded4b0ce42274ebc334c8156c1f","observation_id":"d005cb89-ec4f-4219-824f-e9cb83aa415a","resolution":{"observed_at":"2026-08-06T12:09:39.636062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:314ee5b1b499f85b3cbdd88ac21b702b4bfd18a6da07f09610d27eec827c51eb","observation_id":"83c4f67c-abf3-4632-be6f-9ddc3cb4bbdb","resolution":{"observed_at":"2026-05-11T03:55:56.726774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:03c2020e9dd0ff4a08e5804aec3114b19c877f846ea382f56d857336d2d2cf41","observation_id":"32eafdbe-ed52-49a4-b269-446d843604d6","resolution":{"observed_at":"2026-05-22T05:51:08.263012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":"2505.18086","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-01T22:46:20.251611Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":"4b2b6cf2-4622-48ca-acc9-a321825659e0","year":2025},"citing_paper":{"arxiv_id":"2606.02132","last_updated":"2026-06-02T07:53:40Z","snapshot_observed_at":"2026-08-08T17:59:33.631713Z","submitted_at":"2026-06-01T11:58:55Z","title":"Learning When Not to Act: Mitigating Tool Abuse in Agentic Reinforcement Learning","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T14:59:57.983338Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2606.02132"},"observation_digest":"sha256:6269a35cb2b306752c930484295a6152cb64a9fffab4fbb82736be3167a3b562","observation_id":"6967ca88-cf8c-4aac-a953-bb8e16f81ff5","resolution":{"observed_at":"2026-07-01T22:46:20.253672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-07-14T15:45:54.532529Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T15:45:54.532529Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:c0085349ddb6e91f846bce7cdbc2aa0f8c4de1acc18a01bc2ffb9baddd9d597f","observation_id":"2163f506-be2c-4659-b578-8de3e92f0899","resolution":{"observed_at":"2026-07-14T15:45:54.532529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-02T08:06:10.779080Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T08:06:10.779080Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:4588f7420a87fea31cded2e52c312b395f8f24240242f7e19e5b6081ac60814a","observation_id":"af84df61-620c-4d7d-b0a9-b19de84984bb","resolution":{"observed_at":"2026-08-02T08:06:10.779080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18086","snapshot_observed_at":"2026-08-04T04:30:27.449308Z","title":"Stable reinforcement learning for efficient reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T04:30:27.449308Z"},"links":{"cited_paper":"/paper/2505.18086","citing_paper":"/paper/2607.09786"},"observation_digest":"sha256:e16a3482fb03f481720ba2c77e021e74983c77f88df504b16f6418eac1ea753e","observation_id":"ef30e1dc-c058-4e94-95c1-46f0948119e0","resolution":{"observed_at":"2026-08-04T04:30:27.449308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18086/citation-record","integrity":"/paper/2505.18086/integrity","json":"/paper/2505.18086/citation-record.json","paper":"/paper/2505.18086"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T14:38:42.693276Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.693276Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:e1dc77ce308e68787e34680fae8af28b93ee5cc17242353f59ab00b1ebb30824","observation_id":"c9a7d3d8-c24b-4338-a122-6e5ccd4fa911","resolution":{"observed_at":"2026-08-07T14:38:42.693276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T14:38:42.839047Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.839047Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:4d0663211e4ed16aa8ecf37565ef53761c78361a311de949b277934859a1c201","observation_id":"cbe93923-50d0-41cd-9438-741854849ba4","resolution":{"observed_at":"2026-08-07T14:38:42.839047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:38:42.993274Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:42.993274Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:dd6f8422a018b4206db2af63fabad2a2c243dbdda4a77429ecaa721eb7a50e07","observation_id":"3ca8bd60-b550-43a9-b38e-1fa1042351e7","resolution":{"observed_at":"2026-08-07T14:38:42.993274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T14:38:43.173424Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.173424Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:6fc40000241b43af8fdf9d55748ea84d10b7e53a08b8300a38d73584e728526e","observation_id":"ecb8034f-13b8-4298-b5b8-19ee820e5f47","resolution":{"observed_at":"2026-08-07T14:38:43.173424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:38:43.302144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.302144Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:a596c0ab391f106dba404a58c446f361d1d96c68c852cdbee3ddd2db023f8198","observation_id":"ad775c01-2cc7-44cc-8f75-7f57e29df208","resolution":{"observed_at":"2026-08-07T14:38:43.302144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:38:43.477652Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.477652Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:e2e04935fc4db5af16911715b9dc503e88bc221a12416ffc6cc8b374726aba59","observation_id":"513424c0-8561-4ecf-946a-cf6e63e53b55","resolution":{"observed_at":"2026-08-07T14:38:43.477652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:43.607566Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.607566Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:f4824b2d17d7c9d14075290b3ce3066bffd53522c4d1e970824c0eeed47822d5","observation_id":"a1f10c50-543c-4187-9aba-4dc66166503e","resolution":{"observed_at":"2026-08-07T14:38:43.607566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:38:43.731606Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.731606Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:4c60260da2b0381c66edd6fa034f9b35b7cb4951eb8ad0291af50b48378d9714","observation_id":"5d224063-e1c8-4345-b429-4bca1e0e5344","resolution":{"observed_at":"2026-08-07T14:38:43.731606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:49.523937Z","title":"Group robust preference optimization in reward-free RLHF","venue":null,"work_id":"6636f842-eef1-421b-9065-b80b31de5efb","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.873464Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:7410803d227562f190c9978acb5c2f4f1340864702590eb45dc21c8d4247779f","observation_id":"945cf57e-8403-4d7f-b180-3496e2dbec1a","resolution":{"observed_at":"2026-08-07T14:38:49.661260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T14:38:44.107498Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.107498Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:0c0eb329414db3dfacce11b875d4181d9e0103d2d15d9d1ad60155f0526e9465","observation_id":"2de9ee18-9ab1-4ab1-a720-4f5ab0da98dd","resolution":{"observed_at":"2026-08-07T14:38:44.107498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T14:38:44.256624Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.256624Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:c8ed181213221e6d4b64623ddb43b7f4238be0ab24dc5dba3ad8ee1ac23c9509","observation_id":"09bed22b-4186-4cc2-9e0c-4b544f4540bf","resolution":{"observed_at":"2026-08-07T14:38:44.256624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T14:38:44.377434Z","title":"Do not think that much for 2+3=? on the overthinking of o1-like llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.377434Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:1951718a6d32ad114769a989c4121f6fe2b67057fc66bd2c32451c8b3ecce036","observation_id":"a05546bc-dc99-4b26-8b01-9c0784e78b85","resolution":{"observed_at":"2026-08-07T14:38:44.377434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-08-10T00:41:29.483613Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-07T14:38:44.636364Z","title":"The danger of overthinking: Examining the reasoning-action dilemma in agentic tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.636364Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:5f8c70d0c61680687c7c18b7dfd873f37a0d9136e5055531d6bf551e6be57c3a","observation_id":"b91f5d9f-a288-40d2-8523-5518f8dd2466","resolution":{"observed_at":"2026-08-07T14:38:44.636364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07266","last_updated":"2025-05-27T02:56:52Z","snapshot_observed_at":"2026-08-08T13:14:58.702776Z","submitted_at":"2025-02-11T05:28:59Z","title":"When More is Less: Understanding Chain-of-Thought Length in LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07266","snapshot_observed_at":"2026-08-07T14:38:44.762699Z","title":"When more is less: Understanding chain-of-thought length in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.762699Z"},"links":{"cited_paper":"/paper/2502.07266","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:2a3a73e9a20e12ca1d1cb00d48dde43f463d01c4fdd3ad2c3f8b6481b53e4fb8","observation_id":"1c8b41cd-4bc4-4d55-a372-8f305df9f6cb","resolution":{"observed_at":"2026-08-07T14:38:44.762699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:44.901523Z","title":"Dynamic early exit in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:44.901523Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:f65e40b5264aa22898a7191973f55a1f2cf6c5aca52e14c3c5aeb1a132caa270","observation_id":"88487cad-08c9-4ba8-96d8-177b0f0632c0","resolution":{"observed_at":"2026-08-07T14:38:44.901523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T14:38:45.030627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.030627Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:e0c345797eb0394921c6f8c3efe267479ba26b12e2e36adc0c433f0531dc0000","observation_id":"e6ebe74d-386b-4f74-9ac0-e03020456fba","resolution":{"observed_at":"2026-08-07T14:38:45.030627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07686","last_updated":"2025-05-17T04:01:57Z","snapshot_observed_at":"2026-08-08T14:14:41.258693Z","submitted_at":"2025-05-12T15:50:44Z","title":"S-GRPO: Early Exit via Reinforcement Learning in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07686","snapshot_observed_at":"2026-08-07T14:38:45.299309Z","title":"S-grpo: Early exit via reinforcement learning in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.299309Z"},"links":{"cited_paper":"/paper/2505.07686","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:6c664298869a22e2d3d9670a981f2d24eaa8741874dd42c3c44c49e09b4e58b2","observation_id":"aaaf58df-ce8c-448f-a445-8adae971953e","resolution":{"observed_at":"2026-08-07T14:38:45.299309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:38:45.504178Z","title":"Training verifiers to solve math word problems, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.504178Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:87e56ffe0aa32baf52b53b62f02d7988272df2c078be3d97d0ab61e09bbc7d0b","observation_id":"2ab6bda3-e684-4120-8286-37f5ceb9ed7b","resolution":{"observed_at":"2026-08-07T14:38:45.504178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T14:38:45.622242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.622242Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:ee6e0717056df09b74705bd3188d33647f0cba70440361ac3da68cdf24e6eabc","observation_id":"43b2069d-6689-4980-978e-fa6673d4508a","resolution":{"observed_at":"2026-08-07T14:38:45.622242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:48.795774Z","title":"Aime problems and solutions","venue":null,"work_id":"21fe34a9-096d-40d4-b313-cb8b0329b83e","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.747265Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:c4dc292ddf1eb9b7336ce41ff83e8df648af3ca83475bf9b01e569e5b8240c48","observation_id":"f63de3ea-d04c-4cd4-ac5d-e3a980e3cb62","resolution":{"observed_at":"2026-08-07T14:38:49.078178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:45.879870Z","title":"Amc 2023, 2024","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:45.879870Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:d1239a68a942f1ee051f1bb6894f645e190f1b1395ed395a6e5444bfb46a73e3","observation_id":"f898c5e0-3baa-4776-a942-9b7e0c2f03a1","resolution":{"observed_at":"2026-08-07T14:38:45.879870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:46.047459Z","title":"Measuring mathematical problem solving with the math dataset,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.047459Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:b7a86a4a4376e4779d531de44d00be0e2b31a85dc67ab9ab7fbd6830b41e387b","observation_id":"af2ae48e-fb79-4463-9aec-7e25a8fbac07","resolution":{"observed_at":"2026-08-07T14:38:46.047459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:48.399033Z","title":"Learning to reason with llms","venue":null,"work_id":"a775e4a5-d0b0-469a-a201-408c57cc2c11","year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.312282Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:5bc918a0af57b167d26c379d44619c906d87847fc3131b67ccf05e0a70d0ac16","observation_id":"37b165fe-3c43-458e-999e-5afc1c52a00f","resolution":{"observed_at":"2026-08-07T14:38:48.564499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T14:38:46.432494Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.432494Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:db07c995578a7ac68f902c43d29e45a3cde7ba3fa7b876196ccc818625934d57","observation_id":"71d0c005-ec14-442e-885a-eded273fb183","resolution":{"observed_at":"2026-08-07T14:38:46.432494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15115","last_updated":"2024-11-27T11:58:50Z","snapshot_observed_at":"2026-08-10T16:59:31.408159Z","submitted_at":"2024-10-19T13:53:50Z","title":"On Designing Effective RL Reward at Training Time for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15115","snapshot_observed_at":"2026-08-07T14:38:46.529177Z","title":"On designing effective rl reward at training time for llm reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.529177Z"},"links":{"cited_paper":"/paper/2410.15115","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:98cc8f9f657dcd35deb7a1fe72d01d4932045849a7c37dc63ef342c1fd83bc51","observation_id":"0da1767a-63d3-4bbe-acac-d4186ae8de5c","resolution":{"observed_at":"2026-08-07T14:38:46.529177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T14:38:46.709657Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu, Yuling Gu, Saumya Malik, Victoria Graf, Jena D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.709657Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:d1bcc7ff8a1eaeaa93bca2692a9cc31ecb0babf7ddb4e656e9c1f86ccf62fada","observation_id":"143a71ca-8286-4c91-9cea-81e9229fdd6f","resolution":{"observed_at":"2026-08-07T14:38:46.709657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T14:38:46.831392Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.831392Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:4f9e12e7a1b26e879ba935dd780b696b341a8e75b061c4b1939a17345daae8da","observation_id":"ff791d8f-0479-4963-a508-1360be495822","resolution":{"observed_at":"2026-08-07T14:38:46.831392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-10T16:59:28.676649Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T14:38:46.973811Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.973811Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:11666148fc199e615a5ca36549b9a8e85b28e912d32d9cccf3b088289679167e","observation_id":"8f6d38db-9d42-4123-b1f9-235377011f6b","resolution":{"observed_at":"2026-08-07T14:38:46.973811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:47.135822Z","title":"Fastcurl: Curriculum reinforcement learning with progressive context extension for efficient training r1-like reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.135822Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:d141dd3d5f12308cb9480f63e60fa1692968e86328a6585b065bbaca7a649830","observation_id":"13461ca3-1766-4edb-a8b9-c4016710b253","resolution":{"observed_at":"2026-08-07T14:38:47.135822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:47.237133Z","title":"Training language models to reason efficiently","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.237133Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:0e48a2b3f9793f11d137adc1c10e9ed14de2816050e256ef2d1da0d497bc6a40","observation_id":"ca3c6a0b-18fe-4b0e-a2cf-36a820f24d15","resolution":{"observed_at":"2026-08-07T14:38:47.237133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-10T19:38:46.551479Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-07T14:38:47.403222Z","title":"Deepmath-103k: A large-scale, challenging, decontaminated, and verifiable mathematical dataset for advancing reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.403222Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:7844d2ffac1d1219456a8e0467cee9d4a1297f6c252fdfb3bd543e7d56b85bf5","observation_id":"616be23c-0f78-40a6-8881-8a637368c55a","resolution":{"observed_at":"2026-08-07T14:38:47.403222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-07T14:38:47.561040Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.561040Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:999f5dbae453f647a651f9e9a24a12acfb97fd9030c91b48f49b3bd306599bbe","observation_id":"445767f5-5ddd-4cc7-9d3a-4bb0c17866a8","resolution":{"observed_at":"2026-08-07T14:38:47.561040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T14:38:47.682695Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:47.682695Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:c09a08980eb2bde56b13712d48d307c434db3bade751baac6e78b7eda649a235","observation_id":"456d2ebb-02e8-4cfb-b296-56ce53d3e3d9","resolution":{"observed_at":"2026-08-07T14:38:47.682695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:38:46.155558Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:46.155558Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:76a4c23605af125cbb6d23b524d9e24b5bbcb9fdd4bacbc8a5bd7d1ded555345","observation_id":"ac5f1b6b-6f50-4cac-89de-0faf5272030e","resolution":{"observed_at":"2026-08-07T14:38:46.155558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:38:49.326385Z","title":null,"venue":null,"work_id":"f2451916-f96f-4216-9652-502a36f9d139","year":null},"citing_paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:38:43.956922Z"},"links":{"citing_paper":"/paper/2505.18086"},"observation_digest":"sha256:abe44f95e99216d91f0e31f7ed545c761ac4c232fb98778a7d50a629339966ab","observation_id":"df1278cb-0481-40ff-81f4-9e0813881153","resolution":{"observed_at":"2026-08-07T14:38:49.453422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.18086","last_updated":"2025-05-23T16:43:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T20:28:26.644764Z","submitted_at":"2025-05-23T16:43:03Z","title":"Stable Reinforcement Learning for Efficient Reasoning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 7 inbound Pith citation observations for arXiv:2505.18086."}