{"as_of":"2026-08-09T06:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d325a7edfb5cfd1d9b5097be4274c6df8ef24ceb43fd093419d5e0b1707884f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:26.151443Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:26:23.083412Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2504.19678","last_updated":"2026-03-06T19:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T11:08:22Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:37.873567Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2504.19678"},"observation_digest":"sha256:f5687d8bedf1596c1b863169a5d993206b165fb2a4208668d2c1defeeb2bafc8","observation_id":"941ac46f-d5da-45aa-9232-a13a9bfc8ad8","resolution":{"observed_at":"2026-05-15T02:57:38.259463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T15:42:26.151443Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use.arXiv preprint arXiv:2504.04736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14246","last_updated":"2025-05-20T11:59:25Z","snapshot_observed_at":"2026-08-07T17:35:55.668492Z","submitted_at":"2025-05-20T11:59:25Z","title":"Visual Agentic Reinforcement Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:26.151443Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2505.14246"},"observation_digest":"sha256:9e6f132747fd9393094f09626e85a681aaa98749103c38b12d4142d1f7d1eb8d","observation_id":"a6bd3552-31f0-4518-b16d-d01d8f677910","resolution":{"observed_at":"2026-08-07T15:42:26.151443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T14:44:23.355764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17716","last_updated":"2025-05-23T10:33:14Z","snapshot_observed_at":"2026-08-08T15:42:18.320838Z","submitted_at":"2025-05-23T10:33:14Z","title":"Get Experience from Practice: LLM Agents with Record & Replay","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:23.355764Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2505.17716"},"observation_digest":"sha256:255b788f3a641e20caa2f1f92c8b0bfc0084c8092ab898da108e29ffad8aa1c8","observation_id":"71362ded-996a-4e10-8c80-66dfb4b9f1e6","resolution":{"observed_at":"2026-08-07T14:44:23.355764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T12:13:28.578751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00296","last_updated":"2025-05-30T22:58:35Z","snapshot_observed_at":"2026-08-09T05:17:13.785668Z","submitted_at":"2025-05-30T22:58:35Z","title":"CRScore++: Reinforcement Learning with Verifiable Tool and AI Feedback for Code Review","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:28.578751Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2506.00296"},"observation_digest":"sha256:596180b428de747afd02530deb7b3f0028c2ccb46f5a29654437ebca7f026e98","observation_id":"c96330a2-5f5e-4403-b8c0-954be3c8e936","resolution":{"observed_at":"2026-08-07T12:13:28.578751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T11:21:41.804315Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use.arXiv preprint arXiv:2504.04736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02726","last_updated":"2025-06-03T10:36:38Z","snapshot_observed_at":"2026-08-08T11:50:57.510769Z","submitted_at":"2025-06-03T10:36:38Z","title":"RACE-Align: Retrieval-Augmented and Chain-of-Thought Enhanced Preference Alignment for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:41.804315Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2506.02726"},"observation_digest":"sha256:aa97f204fb34f7c3e6053d85114d315d90b364210d1a62259ac4d46981c616c0","observation_id":"a8369b8b-1fca-444f-92c3-4f022cc3f304","resolution":{"observed_at":"2026-08-07T11:21:41.804315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-07T10:42:39.115854Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04611","last_updated":"2025-06-05T04:02:17Z","snapshot_observed_at":"2026-08-07T13:54:09.003484Z","submitted_at":"2025-06-05T04:02:17Z","title":"Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:39.115854Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2506.04611"},"observation_digest":"sha256:31104e6fb45aa28f4b64f552b4083f357f9e32eceef8a212bbab9b5a3fcf6db4","observation_id":"3a734589-8f92-48a9-b25d-56e36e6999b1","resolution":{"observed_at":"2026-08-07T10:42:39.115854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T23:26:56.609002Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18096","last_updated":"2025-09-03T15:32:23Z","snapshot_observed_at":"2026-08-06T23:20:46.744749Z","submitted_at":"2025-06-22T16:52:48Z","title":"Deep Research Agents: A Systematic Examination And Roadmap","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:56.609002Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2506.18096"},"observation_digest":"sha256:c715bb95ab869e868b1af59e9d24b2a8926f00b0536dce757f504162843487a0","observation_id":"288dda77-2013-491c-8b05-cff357d26bd1","resolution":{"observed_at":"2026-08-06T23:26:56.609002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T23:11:58.302886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19171","last_updated":"2025-06-23T22:10:38Z","snapshot_observed_at":"2026-08-08T10:48:33.185126Z","submitted_at":"2025-06-23T22:10:38Z","title":"Distilling Tool Knowledge into Language Models via Back-Translated Traces","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:11:58.302886Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2506.19171"},"observation_digest":"sha256:f2ce3dba059e8c7e5b188a86a8dd62b30079e1e43b3b79659ec13e5bd7475d29","observation_id":"a150e92a-810d-4da8-abbe-a176a4b9352d","resolution":{"observed_at":"2026-08-06T23:11:58.302886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T20:55:08.936392Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01489","last_updated":"2025-07-02T08:49:43Z","snapshot_observed_at":"2026-08-08T17:47:10.409303Z","submitted_at":"2025-07-02T08:49:43Z","title":"Agent-as-Tool: A Study on the Hierarchical Decision Making with Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:55:08.936392Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2507.01489"},"observation_digest":"sha256:74a93edecec5f84701cf0bf0038a6a59858742ecc6c33e29004ee33c54c54080","observation_id":"4b64dbb8-5014-4415-9e30-908677aa8367","resolution":{"observed_at":"2026-08-06T20:55:08.936392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T20:23:58.523176Z","title":"Anna Goldie, Azalia Mirhoseini, Hao Zhou, Irene Cai, and Christopher D Manning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02851","last_updated":"2025-07-03T17:55:43Z","snapshot_observed_at":"2026-08-06T20:17:25.500348Z","submitted_at":"2025-07-03T17:55:43Z","title":"MOTIF: Modular Thinking via Reinforcement Fine-tuning in LLMs","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:58.523176Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2507.02851"},"observation_digest":"sha256:3d8b867974dfe64da7de8c88498003fe0f5a5aac9b1d3fc079fa3d6c71d4b8c8","observation_id":"bd220da0-e9ad-43e9-b6fd-e1996fb0e4de","resolution":{"observed_at":"2026-08-06T20:23:58.523176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T17:16:54.103748Z","title":"arXiv:2504.04736 [cs.AI] https: //arxiv.org/abs/2504.04736 Google DeepMind","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11371","last_updated":"2025-07-15T14:44:29Z","snapshot_observed_at":"2026-08-06T17:07:04.231936Z","submitted_at":"2025-07-15T14:44:29Z","title":"Step-wise Policy for Rare-tool Knowledge (SPaRK): Offline RL that Drives Diverse Tool Use in LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:16:54.103748Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2507.11371"},"observation_digest":"sha256:e6ec12de8b7aa5d4e3396b1db59ba28f50f792ba24485705d7475e08f0f4a610","observation_id":"cf99c4e5-03f3-4284-9d33-bb448d99d66f","resolution":{"observed_at":"2026-08-06T17:16:54.103748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2508.07407","last_updated":"2025-08-31T14:55:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-10T16:07:32Z","title":"A Comprehensive Survey of Self-Evolving AI Agents: A New Paradigm Bridging Foundation Models and Lifelong Agentic Systems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T23:21:42.029285Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2508.07407"},"observation_digest":"sha256:97f09f757fc8cf37a6bd1ccaded27ce6e2346be751f12378050fa7724c235518","observation_id":"70168ea2-0162-4c4b-90f1-c425f7d5460e","resolution":{"observed_at":"2026-05-15T23:21:42.397702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-04T16:07:29.383625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:29.383625Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:554ad88759820057585ae9409ceeff20ff4b02e28de7839db830a413a91c54e0","observation_id":"1eb84988-09be-4dc8-9337-a1b723f9e5a5","resolution":{"observed_at":"2026-08-04T16:07:29.383625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-04T10:47:58.616326Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08558","last_updated":"2026-05-24T21:56:11Z","snapshot_observed_at":"2026-08-04T10:47:54.049813Z","submitted_at":"2025-10-09T17:59:17Z","title":"Agent Learning via Early Experience","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T10:47:58.616326Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2510.08558"},"observation_digest":"sha256:f1cf5202d2366c03a6834a766fe2896d1789a43d893906a1c629930e4f729dfd","observation_id":"9989590c-175f-49ea-992e-207d1eca1144","resolution":{"observed_at":"2026-08-04T10:47:58.616326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2601.04809","last_updated":"2026-05-04T13:55:24Z","snapshot_observed_at":"2026-07-06T22:41:05.793337Z","submitted_at":"2026-01-08T10:42:04Z","title":"SCALER:Synthetic Scalable Adaptive Learning Environment for Reasoning","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T16:24:04.132572Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2601.04809"},"observation_digest":"sha256:a3366887c15d69deb0a055769c7c2552d0ad428d45d2b1e9d09d02ff27b7aba4","observation_id":"5bc1d60a-e7fa-42b7-abf2-e4b4564a36b4","resolution":{"observed_at":"2026-05-16T16:28:05.728609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2604.18936","last_updated":"2026-04-21T00:21:05Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:21:05Z","title":"Fine-Tuning Small Reasoning Models for Quantum Field Theory","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T03:23:18.770963Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2604.18936"},"observation_digest":"sha256:ae44cd16246afae14531da170c2c811b813757dcd63f87bfdcd7bf90d809349d","observation_id":"3f1600b7-245c-486b-aaa5-00cad53aeb2b","resolution":{"observed_at":"2026-05-11T12:31:06.043412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2604.23333","last_updated":"2026-04-25T14:40:13Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T14:40:13Z","title":"Process Supervision of Confidence Margin for Calibrated LLM Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-08T08:19:09.437464Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2604.23333"},"observation_digest":"sha256:a293c4994bbf0a0f7ef182deee9ed1bff9cb26e53eceb58e3143b2a087602f05","observation_id":"c9324866-5083-4271-b0cc-967a7d707468","resolution":{"observed_at":"2026-05-11T20:41:12.225348Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:08:53.731480Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:83501ba874a9e9af42a1feff8f695f9487c932a5438dad921d7362e873ba4b71","observation_id":"015f74c6-388b-49af-814b-0079ff9a3add","resolution":{"observed_at":"2026-05-11T16:46:06.952986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2605.01248","last_updated":"2026-06-08T23:39:22Z","snapshot_observed_at":"2026-07-06T23:14:29.125042Z","submitted_at":"2026-05-02T05:01:05Z","title":"$S^3$-R1: Learning to Retrieve and Answer Step-by-Step with Synthetic Data","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-01T00:48:54.797750Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2605.01248"},"observation_digest":"sha256:007d6baa314d08acfd363b5d391fe314ba835354ac5591a3982be17f0de415c1","observation_id":"4058fa5e-7634-4bd6-8b2c-85de24e3e2f9","resolution":{"observed_at":"2026-07-01T00:55:12.125531Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T03:45:06.199636Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:93341db44350616c8872ad1aed7fec18c971d8f72a03c9db23e24028d415d1cf","observation_id":"3d28ceff-6fc2-47a2-b680-5f48a6933e2f","resolution":{"observed_at":"2026-05-12T07:06:33.632647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2605.10923","last_updated":"2026-05-17T05:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T17:55:13Z","title":"Dynamic Skill Lifecycle Management for Agentic Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T22:19:49.016156Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2605.10923"},"observation_digest":"sha256:6f3e6aacdae83ffa313f3115b06206a72cf3169ad19bbeda6c11f1dff3dd6d71","observation_id":"3556ff3f-d5ed-4060-81a0-293f833c2f98","resolution":{"observed_at":"2026-05-20T22:23:48.443509Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2606.02908","last_updated":"2026-06-01T21:25:06Z","snapshot_observed_at":"2026-08-04T10:15:05.491861Z","submitted_at":"2026-06-01T21:25:06Z","title":"WRIT: Write-Read Intensive Trajectory Synthesis for Multi-Turn User-Facing Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T14:18:45.821224Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2606.02908"},"observation_digest":"sha256:1a714586194f4b55e6bb94abf681b165d1565d0a187bf0dc7299c15ec08918da","observation_id":"a62075b5-d03b-49d2-a0e8-d4329cca1248","resolution":{"observed_at":"2026-07-01T23:26:23.085582Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":"2504.04736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-07-01T23:26:23.083412Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use","venue":null,"work_id":"43a1e7d7-3843-4da2-84f7-9741d02e12ad","year":2025},"citing_paper":{"arxiv_id":"2606.26122","last_updated":"2026-05-27T21:21:42Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-05-27T21:21:42Z","title":"DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T12:50:16.625077Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2606.26122"},"observation_digest":"sha256:39881b6ec2afbc7ff9f6cf55f8e3b9356526caec3cb2e8e43f103a8154286265","observation_id":"ff9b56ae-1d57-4c40-9193-11888ee39645","resolution":{"observed_at":"2026-06-29T12:53:26.527752Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-02T14:50:11.165028Z","title":"Synthetic data generation & multi-step rl for reasoning & tool use.arXiv preprint arXiv:2504.04736, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-06T07:49:27.049032Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:11.165028Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:4224f90f7c1fda3a3a4d989d596bb8c4d1196f7c043edc31e55e7ce47596eee2","observation_id":"218db873-a18b-4dc8-818e-34e6eed4657c","resolution":{"observed_at":"2026-08-02T14:50:11.165028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04736","snapshot_observed_at":"2026-08-06T04:47:17.289396Z","title":"arXiv preprint arXiv:2504.04736 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05124","last_updated":"2026-08-05T17:50:08Z","snapshot_observed_at":"2026-08-09T06:29:34.292341Z","submitted_at":"2026-08-05T17:50:08Z","title":"Chained Recursive Language Models for Multi-Iteration Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:17.289396Z"},"links":{"cited_paper":"/paper/2504.04736","citing_paper":"/paper/2608.05124"},"observation_digest":"sha256:61be08bea59e777fdf4a268956a513e3e1b3359ae5b4cad9a6b9924b7cba5b80","observation_id":"f7674e92-eec6-4e79-b192-36a5a2754d15","resolution":{"observed_at":"2026-08-06T04:47:17.289396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.04736/citation-record","integrity":"/paper/2504.04736/integrity","json":"/paper/2504.04736/citation-record.json","paper":"/paper/2504.04736"},"outbound":[],"paper":{"arxiv_id":"2504.04736","last_updated":"2025-04-28T01:20:59Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T02:32:49.849718Z","submitted_at":"2025-04-07T05:20:58Z","title":"Synthetic Data Generation & Multi-Step RL for Reasoning & Tool Use"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2504.04736."}