{"as_of":"2026-08-09T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea00e3410afc8fe081bae962d80f8acda8841f2f82b1ee4b371d908e5b31fb32","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":44,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:56:00.206362Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T02:42:26.083324Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T12:04:10.210508Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2409.12917"},"observation_digest":"sha256:f230a8b8e8d6090d6907bd3e85e0605419b0bbba23bd10ea0f83a45f7242b43a","observation_id":"e620d219-e4d2-4d99-b7cc-e5b38a53b4cf","resolution":{"observed_at":"2026-05-17T12:04:10.444859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:5f4190d964caa11628a670e6248f7aa7ff0e0a25f64de0885253b63600c3c85f","observation_id":"5e742e69-9d5d-4e1b-ab04-905424c5eb95","resolution":{"observed_at":"2026-05-21T01:42:19.179140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-07T06:05:27.895209Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T10:29:05.384381Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2412.06769"},"observation_digest":"sha256:87864f862b0b26b7d3dac4a725ad94d649b18778510533539ac7c626f2579a01","observation_id":"81073105-9561-4640-9bdf-431d133e25bb","resolution":{"observed_at":"2026-05-11T10:29:05.706544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-09T14:56:00.206362Z","title":"C., Nalmpantis, C., Dwivedi-Yu, J., Zhuravinskyi, M., Hambro, E., Sukhbaatar, S., and Raileanu, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-09T14:48:44.975426Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:56:00.206362Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.01600"},"observation_digest":"sha256:f215f52081c5972f26c9ba3f20f614e015eb958bc156848606d5f8f6c8663802","observation_id":"5844cb03-48df-4753-95b5-fc08356f6552","resolution":{"observed_at":"2026-08-09T14:56:00.206362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-08T15:11:08.137792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06533","last_updated":"2025-02-10T14:56:25Z","snapshot_observed_at":"2026-08-08T15:05:57.951816Z","submitted_at":"2025-02-10T14:56:25Z","title":"Ignore the KL Penalty! Boosting Exploration on Critical Tokens to Enhance RL Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T15:11:08.137792Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.06533"},"observation_digest":"sha256:82ff676c8f1e813cf1784bbe3e4687bdd74c428939c2c4240338c79e76ce0d73","observation_id":"0d0b062e-1036-4c1f-b7fe-403edeb2d6d2","resolution":{"observed_at":"2026-08-08T15:11:08.137792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-08T14:25:53.357179Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06773","last_updated":"2025-02-10T18:52:04Z","snapshot_observed_at":"2026-08-08T22:57:17.515334Z","submitted_at":"2025-02-10T18:52:04Z","title":"On the Emergence of Thinking in LLMs I: Searching for the Right Intuition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T14:25:53.357179Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.06773"},"observation_digest":"sha256:1c28efb2457799941118efe1bc52bf5822b537a2972d6ea18401719116bc2c60","observation_id":"943e4545-6612-4952-a7c6-53c23682a60a","resolution":{"observed_at":"2026-08-08T14:25:53.357179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T18:39:38.006409Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.10325","last_updated":"2025-02-14T17:34:28Z","snapshot_observed_at":"2026-08-07T22:34:15.668776Z","submitted_at":"2025-02-14T17:34:28Z","title":"Process Reward Models for LLM Agents: Practical Framework and Directions","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T18:39:38.006409Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.10325"},"observation_digest":"sha256:a681970423c8b60104497f7eb73bcf8ffe9b7643cccea3aa7ade8a399044ce55","observation_id":"c98a33f2-13cf-4e37-974c-51909915dc0d","resolution":{"observed_at":"2026-08-07T18:39:38.006409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:05fb05a7faa8696529f5c1192db94b7d006a21bfe7fafd4cd83148e52b82eebc","observation_id":"23390e2f-76d4-4c61-b3fb-2f047a4552c5","resolution":{"observed_at":"2026-05-23T02:42:26.085841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:15:43.520186Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15778","last_updated":"2025-05-21T17:29:15Z","snapshot_observed_at":"2026-08-07T23:55:32.170893Z","submitted_at":"2025-05-21T17:29:15Z","title":"Soft Thinking: Unlocking the Reasoning Potential of LLMs in Continuous Concept Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:43.520186Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.15778"},"observation_digest":"sha256:0020f0ce946679ade0f5eb35ec74827a33a5f1cf4275e6802888594ca9e026f1","observation_id":"1a9aa297-dd75-445b-9d9f-0739788963a9","resolution":{"observed_at":"2026-08-07T15:15:43.520186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:13:43.610133Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15793","last_updated":"2025-05-22T04:48:12Z","snapshot_observed_at":"2026-08-09T06:40:36.946957Z","submitted_at":"2025-05-21T17:47:24Z","title":"HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:43.610133Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.15793"},"observation_digest":"sha256:a15f9da49bc0f6a4142b00b86f3b3ec23ad33c979a28268377575dbd236f0cec","observation_id":"49fc1608-b320-4489-bbfa-ae4d409b03ac","resolution":{"observed_at":"2026-08-07T15:13:43.610133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T15:09:53.173407Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.173407Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:38637c02cc28e53bdb71e148235d34e9e58d0fd70c2ae18958e7ee0951296a89","observation_id":"d19f54ef-db2a-4b5b-867e-f353c9648dd4","resolution":{"observed_at":"2026-08-07T15:09:53.173407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T14:09:22.127164Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19966","last_updated":"2025-05-26T13:26:56Z","snapshot_observed_at":"2026-08-09T07:54:28.149810Z","submitted_at":"2025-05-26T13:26:56Z","title":"Learning to Select In-Context Demonstration Preferred by Large Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:09:22.127164Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.19966"},"observation_digest":"sha256:597afd8db371c852ef2d160c8480b03f63a6e89c64ebd103f79f13ccba506722","observation_id":"2120d7eb-4477-465d-8dea-891dc5dd9fb2","resolution":{"observed_at":"2026-08-07T14:09:22.127164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2505.23912","last_updated":"2026-05-13T21:21:09Z","snapshot_observed_at":"2026-08-02T15:55:45.353476Z","submitted_at":"2025-05-29T18:05:20Z","title":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-19T12:43:51.019983Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.23912"},"observation_digest":"sha256:e7b1cb026b11c6d424bf2e420b3b8ff2448c3816e4fe03b9f11e787bdf70ea3e","observation_id":"b280998b-7aeb-4866-9259-74fd9d347658","resolution":{"observed_at":"2026-05-19T12:47:17.959953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:38:59.544322Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24181","last_updated":"2025-05-30T03:43:24Z","snapshot_observed_at":"2026-08-09T10:33:44.915335Z","submitted_at":"2025-05-30T03:43:24Z","title":"SCOUT: Teaching Pre-trained Language Models to Enhance Reasoning via Flow Chain-of-Thought","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:38:59.544322Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.24181"},"observation_digest":"sha256:2accc889a709ba5224c319d47aa03111e4e083f4e18f5fee2ca692c2349fff33","observation_id":"7e35f750-3716-42a7-88b1-4dbb4526b9d0","resolution":{"observed_at":"2026-08-07T12:38:59.544322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:19:28.455709Z","title":"Havrilla, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-09T06:28:01.755194Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:28.455709Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2505.24871"},"observation_digest":"sha256:a6e73e70e9360149cf4c216d20457ebdb908ae139109d38407df05ce9b64bc95","observation_id":"e135594d-1c46-4d77-8a61-9b2fe77ab4d0","resolution":{"observed_at":"2026-08-07T12:19:28.455709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T10:28:19.442762Z","title":"C., Nalmpantis, C., Dwivedi-Yu, J., Zhuravinskyi, M., Hambro, E., Sukhbaatar, S., and Raileanu, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05109","last_updated":"2025-06-05T14:53:35Z","snapshot_observed_at":"2026-08-08T02:17:06.461305Z","submitted_at":"2025-06-05T14:53:35Z","title":"Truly Self-Improving Agents Require Intrinsic Metacognitive Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:28:19.442762Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.05109"},"observation_digest":"sha256:ee46386ab7896d011566ec34a75b61aa79c4fddf75764c81834601e1db1fa3d9","observation_id":"a53a291c-66f3-4219-8f0f-dc8fd58cf89f","resolution":{"observed_at":"2026-08-07T10:28:19.442762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T04:53:56.348495Z","title":"arXiv preprint arXiv:2403.04642","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-08T13:48:32.149553Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:53:56.348495Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.09340"},"observation_digest":"sha256:16b48bb3e629f33315a8ec93186b4facf1661886525644ebb72268ef55c528fb","observation_id":"28fa47da-3602-46cb-bef4-1b7022a8e596","resolution":{"observed_at":"2026-08-07T04:53:56.348495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T04:47:42.354458Z","title":"Teaching large language models to reason with reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09659","last_updated":"2025-06-11T12:26:45Z","snapshot_observed_at":"2026-08-09T12:44:08.942028Z","submitted_at":"2025-06-11T12:26:45Z","title":"Intent Factored Generation: Unleashing the Diversity in Your Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T04:47:42.354458Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.09659"},"observation_digest":"sha256:1e249ce58d909ad33586123d1eedae469097238e1aedd93ea72b6a44e21d932a","observation_id":"1c3bf2f5-bbaa-4cbe-aa0d-b4f53a75aaf8","resolution":{"observed_at":"2026-08-07T04:47:42.354458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T12:19:53.893423Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15710","last_updated":"2025-05-30T17:57:08Z","snapshot_observed_at":"2026-08-08T01:06:17.296161Z","submitted_at":"2025-05-30T17:57:08Z","title":"RAST: Reasoning Activation in LLMs via Small-model Transfer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:19:53.893423Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.15710"},"observation_digest":"sha256:f36f690f643ba675c9c7bade686c3f3b74a93769e53872784bc100e25ae3a5a8","observation_id":"31b4fc56-00b6-434c-9a07-5a53afa3bab2","resolution":{"observed_at":"2026-08-07T12:19:53.893423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T22:04:00.026680Z","title":"C., Nalmpantis, C., Dwivedi-Yu, J., Zhuravinskyi, M., Hambro, E., Sukhbaatar, S., and Raileanu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22769","last_updated":"2025-06-28T06:13:13Z","snapshot_observed_at":"2026-08-06T21:55:50.977658Z","submitted_at":"2025-06-28T06:13:13Z","title":"Learning Efficient Robotic Garment Manipulation with Standardization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:04:00.026680Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2506.22769"},"observation_digest":"sha256:34ec11b787415a97b09d94d0933cd9e8078cedfd3c84713c5a2c0f08a16391d4","observation_id":"30cebf1b-9edf-4c93-a4c6-0d06a81f86d1","resolution":{"observed_at":"2026-08-06T22:04:00.026680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-07T10:19:04.082222Z","title":"Teach- ing large language models to reason with reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02870","last_updated":"2025-06-06T10:50:08Z","snapshot_observed_at":"2026-08-08T01:09:03.836574Z","submitted_at":"2025-06-06T10:50:08Z","title":"Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:04.082222Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.02870"},"observation_digest":"sha256:ae3948297e3629767b1bdaadd636e9d928128017ba9ce53d2ad89442db44c534","observation_id":"1e441468-f270-49bd-8275-064d1d46a9b2","resolution":{"observed_at":"2026-08-07T10:19:04.082222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T15:07:27.843871Z","title":"Teaching large lan- guage models to reason with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16773","last_updated":"2025-07-22T17:21:36Z","snapshot_observed_at":"2026-08-09T00:26:11.378062Z","submitted_at":"2025-07-22T17:21:36Z","title":"When LLMs Copy to Think: Uncovering Copy-Guided Attacks in Reasoning LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:27.843871Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.16773"},"observation_digest":"sha256:28f62385fb648167e786946ee9d7f0afc92dc5da3c790c2ac18e501bb746c117","observation_id":"32d4999e-f949-4bcf-ba50-b84d03b796ca","resolution":{"observed_at":"2026-08-06T15:07:27.843871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-06T10:44:26.838066Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23541","last_updated":"2026-07-28T08:43:59Z","snapshot_observed_at":"2026-08-09T00:08:15.328289Z","submitted_at":"2025-07-31T13:31:01Z","title":"Med-R$^3$: Enhancing Medical Retrieval-Augmented Reasoning of LLMs via Progressive Reinforcement Learning","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:44:26.838066Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2507.23541"},"observation_digest":"sha256:7b887e20799adbc559877d69b0cfe39ed88bd0b82f46436d5a6d6ac777b394fe","observation_id":"2ee5efad-7c3b-49cb-b87e-062e32774c0e","resolution":{"observed_at":"2026-08-06T10:44:26.838066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2508.00222","last_updated":"2026-04-15T11:41:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-31T23:55:29Z","title":"RL-PLUS: Countering Capability Boundary Collapse of LLMs in Reinforcement Learning with Hybrid-policy Optimization","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T01:15:49.658412Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2508.00222"},"observation_digest":"sha256:5fba1ecd8bb35f8ab2a3628a8827d51cfe8892d6c9c879fe8aec12688f09ffd2","observation_id":"4cccdf65-b86f-4eaa-8584-d24c5534aadb","resolution":{"observed_at":"2026-05-19T01:16:57.097300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2508.16745","last_updated":"2026-05-07T14:29:44Z","snapshot_observed_at":"2026-08-02T06:49:37.602255Z","submitted_at":"2025-08-22T18:57:08Z","title":"Beyond Memorization: Extending Reasoning Depth with Recurrence, Memory and Test-Time Compute Scaling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T20:49:26.966293Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2508.16745"},"observation_digest":"sha256:14af581ee86578aa06b717905be1e222425a1913d92ac09d17dae6342cfa7560","observation_id":"d1ae46cd-7879-4233-b5ff-171a85413323","resolution":{"observed_at":"2026-05-18T20:51:50.809262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-04T10:53:08.022212Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08048","last_updated":"2026-07-03T14:18:07Z","snapshot_observed_at":"2026-08-05T20:53:04.046643Z","submitted_at":"2025-10-09T10:34:39Z","title":"TaoSR-AGRL: Adaptive Guided Reinforcement Learning Framework for E-commerce Search Relevance","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T10:53:08.022212Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.08048"},"observation_digest":"sha256:85ac5931826da516f34e4b82880992a95af53f58c6b93f9ce325d4a05ae8e173","observation_id":"7c481f30-7042-4931-9867-16411b6c3d47","resolution":{"observed_at":"2026-08-04T10:53:08.022212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:16:28.008746Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2510.18471"},"observation_digest":"sha256:6865a41f542c0e1fd7da81542ebd22c2d90ce31aea75875716f07c445b6cf7ae","observation_id":"86d251eb-e19e-42fc-aca2-e7b41d675a63","resolution":{"observed_at":"2026-05-18T05:20:54.606098Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2512.07461","last_updated":"2026-05-14T12:43:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-08T11:39:43Z","title":"Native Parallel Reasoner: Reasoning in Parallelism via Self-Distilled Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T01:11:26.411893Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2512.07461"},"observation_digest":"sha256:f60bba84a799e1eed44945bb3d9dc67d257ba6c0c33eedd25340c0c36b527155","observation_id":"f7fc2164-4bbc-444f-8172-de9b9d233944","resolution":{"observed_at":"2026-05-17T01:13:47.929498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.08299","last_updated":"2026-04-19T12:06:32Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T14:32:07Z","title":"SeLaR: Selective Latent Reasoning in Large Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T18:27:36.132030Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.08299"},"observation_digest":"sha256:cb33487c76fdb6d96f6d6a6cadb01efe23a8165d96c6668616975733c16e3242","observation_id":"f81f4d0a-b7c7-4490-9bbc-57456cdccdf8","resolution":{"observed_at":"2026-05-11T00:35:49.556259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.16382","last_updated":"2026-03-25T20:54:12Z","snapshot_observed_at":"2026-08-03T07:36:56.480996Z","submitted_at":"2026-03-25T20:54:12Z","title":"LiFT: Does Instruction Fine-Tuning Improve In-Context Learning for Longitudinal Modelling by Large Language Models?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T00:13:44.570359Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.16382"},"observation_digest":"sha256:23ee53bf937f39166380818ad72b083c5f8b7ec27cb99baa2df4107d334e12e5","observation_id":"3fa2893a-9d5a-40d5-a0d3-b56879453ce5","resolution":{"observed_at":"2026-05-15T00:18:22.899179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:be758908b77f684cb34d6652d35717e3a4d1770d882c0af1e820a5756a5d38a4","observation_id":"6a38efa3-6279-45c4-b446-85466f863fef","resolution":{"observed_at":"2026-05-11T14:16:06.034886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.05226","last_updated":"2026-05-23T13:20:07Z","snapshot_observed_at":"2026-07-06T23:17:52.987860Z","submitted_at":"2026-04-19T10:33:19Z","title":"Internalizing Outcome Supervision into Process Supervision: A New Paradigm for Reinforcement Learning for Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T06:13:09.898530Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.05226"},"observation_digest":"sha256:4e69a12b62a1ba0a8e1850a47e5c905ef71aec272be20451a495429552490b49","observation_id":"94c2ee82-3972-41d2-9102-f160f9404b65","resolution":{"observed_at":"2026-05-10T06:26:27.797962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.05893","last_updated":"2026-05-07T09:03:49Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:03:49Z","title":"Logic-Regularized Verifier Elicits Reasoning from LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T10:54:01.229934Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.05893"},"observation_digest":"sha256:ccb5281e654b8f8c223f1a6ef520629e22a82abbbee1e28611c4161556165eb8","observation_id":"d02a8372-ccfc-427e-8cbc-d60d3256639e","resolution":{"observed_at":"2026-05-11T19:51:10.941397Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.08221","last_updated":"2026-05-06T13:58:55Z","snapshot_observed_at":"2026-07-06T23:20:28.875586Z","submitted_at":"2026-05-06T13:58:55Z","title":"NoisyCoconut: Counterfactual Consensus via Latent Space Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T00:51:40.815981Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.08221"},"observation_digest":"sha256:716de1cad326430274d6f25987f7334d2f002511e95b05642fd173cd559c4985","observation_id":"dda6e555-6545-49a4-8474-436f8a5da3d9","resolution":{"observed_at":"2026-05-12T08:41:24.258184Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.11328","last_updated":"2026-05-11T23:26:30Z","snapshot_observed_at":"2026-08-02T08:39:07.747479Z","submitted_at":"2026-05-11T23:26:30Z","title":"Epistemic Uncertainty for Test-Time Discovery","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:52:41.192353Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.11328"},"observation_digest":"sha256:186d14d19d02efa45f73ffd0af18ab98dcfa09623ceaabf81916495a0efd6844","observation_id":"d6d976ea-a5e7-40f6-8fe6-1d56bae82ff5","resolution":{"observed_at":"2026-05-13T01:57:06.061818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2605.11746","last_updated":"2026-05-12T08:24:47Z","snapshot_observed_at":"2026-08-03T19:32:09.592136Z","submitted_at":"2026-05-12T08:24:47Z","title":"When Reasoning Traces Become Performative: Step-Level Evidence that Chain-of-Thought Is an Imperfect Oversight Channel","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T06:30:12.558660Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2605.11746"},"observation_digest":"sha256:0d590a46380a5881ac39c480ef435ee60bc06a3f465a20987ae3660d9d3b0193","observation_id":"c81a34d1-d755-4ac4-914f-1d137bb1437d","resolution":{"observed_at":"2026-05-13T06:32:24.335451Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T11:29:31.754741Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-08T16:37:02.317008Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-08-02T11:29:31.754741Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2606.14502"},"observation_digest":"sha256:5980419723ca72f126253d3af45021f84cd6b2597e3484b4e594e2ae77df8cb8","observation_id":"9a1e33e8-a197-49ed-ae07-e9a23d3c2147","resolution":{"observed_at":"2026-08-02T11:29:31.754741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2403.04642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1c5adb8ff9aff10503e816e7afa2ec87735fc0d929f2ceef9dc300dd1b89706a","observation_id":"40d461bd-51fb-4411-a91d-074baac150f9","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T08:40:36.004785Z","title":"arXiv preprint arXiv:2403.04642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:36.004785Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:b77584e872b7d1e9cd14f70c91d72d0acda73c96d013efabdea31efca0c19777","observation_id":"15e17f8c-3d1d-4117-a752-b61ea7913795","resolution":{"observed_at":"2026-08-02T08:40:36.004785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-02T13:26:28.373498Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18266","last_updated":"2026-05-21T15:50:29Z","snapshot_observed_at":"2026-08-07T22:53:32.484235Z","submitted_at":"2026-05-21T15:50:29Z","title":"Structured Synthetic Reasoning Data for Arithmetic Fine-Tuning of Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T13:26:28.373498Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.18266"},"observation_digest":"sha256:9d14bde48f1ca199cf1acb5575125e337636b2a0e166666df572c308204c16c0","observation_id":"58f57867-c9d6-4227-84b9-37c8ca272be2","resolution":{"observed_at":"2026-08-02T13:26:28.373498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T06:32:19.440448Z","title":"Teaching large language models to reason with reinforcement learning.arXiv preprint arXiv:2403.04642, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:19.440448Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:e74f55aa59c72d0343797f0dad061cf8463eedb150c30c0adfb7ca1b35eb12f5","observation_id":"d3178038-8e0d-482d-b8e8-4a088c93762d","resolution":{"observed_at":"2026-08-01T06:32:19.440448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T07:34:56.790463Z","title":"arXiv preprint arXiv:2403.04642 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24833","last_updated":"2026-07-23T15:12:39Z","snapshot_observed_at":"2026-08-06T04:07:27.160602Z","submitted_at":"2026-07-23T15:12:39Z","title":"AdaKP: Online Adaptive Knowledge-Point Selection for Reasoning-Oriented Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T07:34:56.790463Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.24833"},"observation_digest":"sha256:d7446500be9d3570e3cbd4033ed8fa2f2ea376ed64fcfb60e741f0bb81624c3c","observation_id":"46f0c937-c1c1-42b7-b42e-7b9169cd431c","resolution":{"observed_at":"2026-08-01T07:34:56.790463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-01T00:57:34.320933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25996","last_updated":"2026-07-28T17:12:41Z","snapshot_observed_at":"2026-08-08T13:45:03.380671Z","submitted_at":"2026-07-28T17:12:41Z","title":"RepoReasoner: Evaluating Repository-Level Code Reasoning Ability of Long-Context Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:57:34.320933Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2607.25996"},"observation_digest":"sha256:f975209bd8f4e891990497793131ef9d1abcce26d158ac9c42f54ca4c4278ccd","observation_id":"639afc79-1014-4fc7-896c-13a2914bd6db","resolution":{"observed_at":"2026-08-01T00:57:34.320933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-08-05T15:25:40.180493Z","title":"Teaching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03644","last_updated":"2026-08-04T13:29:00Z","snapshot_observed_at":"2026-08-08T18:58:23.959751Z","submitted_at":"2026-08-04T13:29:00Z","title":"Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details","version":1},"reference_index":193,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:40.180493Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2608.03644"},"observation_digest":"sha256:cb1263d3fb56b89f9a1984146752a32519d4a67f865b71a6fe68e2f97f56be34","observation_id":"3b9c5573-8ad2-4bc5-88c1-ea212ae184dc","resolution":{"observed_at":"2026-08-05T15:25:40.180493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.04642/citation-record","integrity":"/paper/2403.04642/integrity","json":"/paper/2403.04642/citation-record.json","paper":"/paper/2403.04642"},"outbound":[],"paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T01:30:54.327974Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 44 inbound Pith citation observations for arXiv:2403.04642."}