{"as_of":"2026-08-17T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b79fa425bfafc3179d31340c8c7519c53efa43cb1a8d289d6508cf74ee3fe06d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T05:57:49.286939Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:56:36.611575Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"cited_work":{"arxiv_id":"2605.12070","doi":"10.48550/arxiv.2605.12070","metadata_source":"pith","pith_arxiv_id":"2605.12070","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","venue":"cs.LG","work_id":"fc90bc76-d616-4cc5-8a0f-243b0a949e63","year":2026},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-07T06:27:15.086404Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:36.611575Z"},"links":{"cited_paper":"/paper/2605.12070","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:978699a732349c34993513be5d899b209eb93f9da753109b91be0c046448652b","observation_id":"f891b82f-e12e-4294-8fd7-2d1871075466","resolution":{"observed_at":"2026-08-02T08:58:21.176076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.12070/citation-record","integrity":"/paper/2605.12070/integrity","json":"/paper/2605.12070/citation-record.json","paper":"/paper/2605.12070"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:57.086056Z","title":"Back to basics: Revisiting reinforce-style optimization for learning from human feedback in llms","venue":null,"work_id":"f42c8e62-7c0d-4824-b1a2-906653781f5c","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:fcf808a5c1f8241b610c6ccf8a07bb744bb6741a8438d204ca8191fcfde76302","observation_id":"4a5e0c94-92bd-403e-8da9-d4993c90e2a6","resolution":{"observed_at":"2026-05-13T09:42:33.922725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":"65bd13f6-c36f-448c-86fb-2feb9f02e93d","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:e0d5ac389c80939d2ef396ab35913abdee237e368a2308c982dcf6f70031f554","observation_id":"86d40475-e663-4cba-b2b3-22c2e2a98b27","resolution":{"observed_at":"2026-05-13T09:42:33.920908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:174626c8782da8ca042807f045379c8d470f35a6450f36b9ffcc4bc59af324d2","observation_id":"58d05ae4-e8f2-4793-8c7d-7813d40ae441","resolution":{"observed_at":"2026-05-13T06:02:23.557756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2506.13585","doi":"10.1109/tkde.2022.3168611","metadata_source":"pith","pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","venue":"cs.CL","work_id":"c59fbe20-f41e-4140-a81c-40a12e7e8364","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:e289ce1a3018a54c4849bfbeccab85db1d20b0073d9680d1e92dda1873dcc834","observation_id":"243d28b7-4cab-4dcb-aa7b-30b7bef80327","resolution":{"observed_at":"2026-05-13T06:02:23.573116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-08-14T09:16:00.399049Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":"2507.19849","doi":"10.48550/arxiv.2507.19849","metadata_source":"pith","pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Reinforced Policy Optimization","venue":"cs.LG","work_id":"6cb0d241-5e4d-44ed-9476-659819ec0681","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:2b7b4b45de64f2e40a950ca3818507776114474b4aff6a10ff13f55e260a1a64","observation_id":"d4f29b51-a9d4-4994-8318-68e2048ae54d","resolution":{"observed_at":"2026-05-17T02:57:12.173630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":"144050d5-ea2f-44d6-a8e6-c310ad9da4d6","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:dcadfb4846ce2cd6f7aed0b91629b1693aa51f83e020330a00a376904fb8b742","observation_id":"d6efb9a3-b5a1-4520-8e78-302bf9fe19b1","resolution":{"observed_at":"2026-05-13T09:42:33.918869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05765","last_updated":"2026-04-07T08:14:29Z","snapshot_observed_at":"2026-08-15T04:19:25.226738Z","submitted_at":"2026-02-05T15:30:23Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","version":2},"cited_work":{"arxiv_id":"2602.05765","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.05765","snapshot_observed_at":"2026-07-02T21:27:24.190925Z","title":"RL-VLA$^3$: A Flexible and Asynchronous Reinforcement Learning Framework for VLA Training","venue":"cs.AI","work_id":"9ad87be3-d22a-4d2d-a2e7-3cf44f51edd3","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.05765","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:c0169c0ee15c7c2c3310aa8262520ad3b592d38651cd39dbb3980f29a54dd82b","observation_id":"80e444e8-3257-47cd-9d51-1af09203b22a","resolution":{"observed_at":"2026-05-13T06:02:23.570402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26490","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:39:44.801876Z","title":"Vitabench: Benchmarking llm agents with versatile interactive tasks in real-world applications","venue":null,"work_id":"a9d216f9-8bb8-457e-a320-d1457744f75b","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:8366a5ded1dfb29f0b54ac575e0085151fdc27afd6097da966f0ba3142b798c7","observation_id":"23f2fcd8-c8fc-4b4e-bc46-400f0d170df4","resolution":{"observed_at":"2026-05-13T06:02:23.564409Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Batch size-invariance for policy optimization","venue":null,"work_id":"6e4e4cf7-929a-4528-9d51-c0a455765ed8","year":2022},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:1ab7b4ea6592773d0153d9a8c464edcc6e310053342eada3bde0ac13cb7d86d2","observation_id":"a77987df-108c-4545-9349-22f3e287bc09","resolution":{"observed_at":"2026-05-13T09:42:33.924421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.17616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable asynchrony: Variance-controlled off-policy rl for llms","venue":null,"work_id":"7f06e052-92f2-4060-aab6-393ffb9ec423","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:3ecce814d2540808b5f262634fbb6b79b021ab37f45de1b5025f89f6a59a4ee4","observation_id":"6083ae74-36f4-4064-aea4-5312a80d8551","resolution":{"observed_at":"2026-05-13T06:02:23.561246Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T09:02:13.068592Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"55d06a5a-70ca-433f-966a-21dd9d276d2b","year":2023},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:9449e251558447ed22d63668a7c5996a89c015539a42d636c68d87a2b12176db","observation_id":"b3444ef2-1355-4175-a5ed-9daa6d8c2ab2","resolution":{"observed_at":"2026-05-13T09:42:33.902836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.06547","last_updated":"2026-08-12T17:58:33Z","snapshot_observed_at":"2026-08-15T23:11:59.777897Z","submitted_at":"2025-12-06T19:37:39Z","title":"A-3PO: Accelerating Asynchronous LLM Training with Staleness-aware Proximal Policy Approximation","version":4},"cited_work":{"arxiv_id":"2512.06547","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2512.06547","snapshot_observed_at":"2026-08-13T02:25:25.422196Z","title":"A-3po: Accelerating asynchronous llm training with staleness-aware proximal policy approximation","venue":null,"work_id":"12f20c93-c3e0-4e31-9b1a-e81c52887246","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2512.06547","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:2b8015d1b98873211685f8902404a7a7ab473f68bb392eb638857f12e94349e4","observation_id":"9934be26-66fd-4b6b-9e49-ce933009aa73","resolution":{"observed_at":"2026-08-13T02:25:25.422196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When speed kills stability: Demystifying RL collapse from the training-inference mismatch","venue":null,"work_id":"82329cdf-d2ee-4cc2-abcb-238497d9fc41","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:878b0f5135b0a45399c159cb27e3ddff2b47a382958cad5015bc5588f934741f","observation_id":"b829d819-d35e-4b0c-9cd7-5b8de5cde411","resolution":{"observed_at":"2026-05-13T09:42:33.900937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.11370","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.153429Z","title":"Stabilizing MoE Reinforcement Learning by Aligning Training and Inference Routers","venue":null,"work_id":"4df9a4a1-3908-4d16-9c0b-253bb245a0c4","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:784b872da4034677877fdcfe7151f474b15315682e617e71a79128ab1f3a0d85","observation_id":"736074fc-6e75-4b52-a98a-b7676343e11d","resolution":{"observed_at":"2026-05-13T06:02:23.522294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04879","last_updated":"2026-05-26T12:42:28Z","snapshot_observed_at":"2026-08-17T20:22:28.455264Z","submitted_at":"2026-02-04T18:59:04Z","title":"Rethinking the Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2602.04879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04879","snapshot_observed_at":"2026-07-09T22:26:37.209549Z","title":"Rethinking the trust region in llm reinforcement learning","venue":"cs.LG","work_id":"d2127175-a1c0-405f-b108-d2f862a0d427","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.04879","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:518ccf9b98dac1a99fc68397503074c12199f2f66411d07f46c437267d0a17b9","observation_id":"b2d56bc3-d8b7-4202-9c32-dc064c6545e0","resolution":{"observed_at":"2026-05-27T02:05:11.603431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14286","last_updated":"2025-03-19T14:25:30Z","snapshot_observed_at":"2026-08-16T12:48:57.666544Z","submitted_at":"2025-03-18T14:23:37Z","title":"Tapered Off-Policy REINFORCE: Stable and efficient reinforcement learning for LLMs","version":2},"cited_work":{"arxiv_id":"2503.14286","doi":"10.48550/arxiv.2503.14286","metadata_source":"pith","pith_arxiv_id":"2503.14286","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tapered off-policy REINFORCE: Stable and efficient reinforcement learning for LLMs","venue":"cs.LG","work_id":"885b5bf5-7859-4e5a-af07-52a7da4f25c1","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2503.14286","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:5bbd5b4632ebc1489e27d34d60a0495b43a4ebd5fe2d08376b199dba7dcaf533","observation_id":"80cabeb2-26d8-4292-8949-9e574954a27f","resolution":{"observed_at":"2026-05-13T06:02:23.512700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:597a511e1f85b5aecc98bedec0f7adf9b7f6e53c78371af04c9748c151f64b68","observation_id":"da8b7d41-10d5-40c8-9ec7-8343a3ae2312","resolution":{"observed_at":"2026-05-13T06:02:23.502320Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:b1584ace0ca3078ebe8739cab6a2715337e62a80897b67849e81f5fbff85ce17","observation_id":"c1cfbc40-68d0-45cd-9e44-0d264e6ef316","resolution":{"observed_at":"2026-05-13T06:02:23.505475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10693","last_updated":"2026-05-08T10:19:00Z","snapshot_observed_at":"2026-07-06T22:45:25.047172Z","submitted_at":"2026-02-11T09:48:08Z","title":"VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training","version":3},"cited_work":{"arxiv_id":"2602.10693","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.10693","snapshot_observed_at":"2026-06-29T23:24:02.192004Z","title":"VESPO: Variational Sequence-Level Soft Policy Optimization for Stable Off-Policy LLM Training","venue":"cs.LG","work_id":"4a29dafc-cbbe-406e-a56a-0fd2f1ed5dcb","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.10693","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:1ea8b9ab06ea283c4456a3800f704471dadfad2c27bb91e46043125467cfc0f7","observation_id":"a3b1edf2-5521-487b-a66f-f39d305372c9","resolution":{"observed_at":"2026-05-13T06:02:23.516131Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12633","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:29:56.839451Z","title":"Laminar: A scalable asyn- chronous rl post-training framework","venue":null,"work_id":"bcbca89e-28ee-4440-9d4e-eb8a792cce4d","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:f532b01e077c54b4fba45ce73741fa2d06a456bf06195aa5ffbc98734338b016","observation_id":"22f492b9-3b1c-4b79-992f-c61670db853c","resolution":{"observed_at":"2026-05-13T06:02:23.508737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T17:35:10.023423Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":"37ada09c-055c-4ab6-99e5-393107343cd6","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:391882ee3048fd14f67ac080dc0188c37adb6ce8cdf272e3431b214ed541ce2d","observation_id":"fd249724-412f-4d96-8d1a-171b34535e21","resolution":{"observed_at":"2026-05-13T09:42:33.915476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.07629","doi":"10.48550/arxiv.2508.07629","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Klear-reasoner: Advancing reasoning capability via gradient-preserving clipping policy optimization.arXiv preprint arXiv:2508.07629","venue":"ArXiv.org","work_id":"2d3fe64a-7a53-4e46-b832-c2a7bb443af1","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:7d304d172375e8ac310ec13d697417cd89540b97f0780a2190d75de384b24f7a","observation_id":"63cb8be7-490c-480a-9b90-15f5bd778d5b","resolution":{"observed_at":"2026-05-13T06:02:23.549528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:84b51062d63c873057dc0255ce77a43006e843ef0ee05165389a9d41ebb68236","observation_id":"b20ee37d-8e70-47fa-b22a-ab0bdb940594","resolution":{"observed_at":"2026-05-13T06:02:23.540340Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.18855","doi":"10.48550/arxiv.2510.18855","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Every step evolves: Scaling reinforcement learning for trillion-scale thinking model","venue":"arXiv (Cornell University)","work_id":"8416f1a4-8196-4d83-84f4-eddf5383dd70","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:f7139490cece4ec3d9a8da004e8f52fb5fd25a1a1316097ccecc89e64a508c9e","observation_id":"4dab0159-f0c5-4a6b-b257-86db61318b35","resolution":{"observed_at":"2026-05-13T06:02:23.546490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.04705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:46:28.830041Z","title":"Ernie 5.0 technical report","venue":null,"work_id":"ffbea6f7-8129-4c8d-bcbf-1aa4cf16cf5f","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:51207bdb85a34e5bc65f1219e566b50063c8168720e50e04382036a5913e18af","observation_id":"3665664e-ce1f-4476-8860-bfcb504be7e3","resolution":{"observed_at":"2026-05-13T06:02:23.543107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:4c0907288a6e70507e8af4a4be82141302329565217898b525ac696909afac75","observation_id":"f3660f3f-d005-46a3-a023-10a31f34b7e2","resolution":{"observed_at":"2026-05-13T06:02:23.534275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:26:14.207661Z","title":"Let it flow: Agentic crafting on rock and roll, building the rome model within an open agentic learning ecosystem","venue":null,"work_id":"a1afde43-96e3-49c9-af14-25f128d65fe3","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:bd85e67b923e3284ed7cb299f585790d3dfcd533c8fbd1b7bb9da118c216b867","observation_id":"1b87c563-85bb-43ec-9f24-4f665cfaa99a","resolution":{"observed_at":"2026-05-13T06:02:23.537635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-14T07:48:23.313445Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:0f798a8ed9162ba718151368ed21909c843208df105c68cad20531694594a238","observation_id":"b029efc2-fed6-4bf5-823d-cfee5f79ba8a","resolution":{"observed_at":"2026-05-13T06:02:23.524895Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.703557+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.703557+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your efficient rl framework secretly brings you off-policy rl training, August 2025","venue":null,"work_id":"b940eb8d-64de-4a02-bd25-843abf91f10f","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:ccb3e230f7572fb5990ebef2478e123c1bb0287a8b78b0470296acdf852a3f92","observation_id":"07b90231-bb85-44e8-94df-75d358c4b7cb","resolution":{"observed_at":"2026-05-13T09:42:33.910212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Your efficient rl framework secretly brings you off-policy rl training, august 2025.URL https://fengyao","venue":null,"work_id":"f44c7225-73e5-4493-8dcd-53375ba33a8e","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:af930ecf5c39fc50b8c00c74896f756d69cb5814d06f433b93194429e3718ed1","observation_id":"32303e9a-21cb-447b-b9b0-b2788502cca5","resolution":{"observed_at":"2026-05-13T09:42:33.917217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:b73253d307fbb1fc9913bfcf7606401493dbd66d2afab964ef651ca6b5e9e2c1","observation_id":"26ad966d-6e42-4bc6-b296-acd744d36442","resolution":{"observed_at":"2026-05-13T06:02:23.530861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:bccad7372997da96553aa99e3dcb7fe56e976f8377b6c74ff1d575ad1f265c5f","observation_id":"141c3492-816f-4804-b0a7-14d2c7e4c070","resolution":{"observed_at":"2026-05-13T06:02:23.554770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The landscape of agentic reinforcement learning for llms: A survey.Transactions on Machine Learning Research","venue":null,"work_id":"eccab108-6a63-4a1a-9560-d5336ca8de4f","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:4b365ed6c64ba00333df26e8c50780b7dcf10e3394910edb475a64708ccca805","observation_id":"99f9e4b1-c3e1-4ede-a81c-539796e9fa94","resolution":{"observed_at":"2026-05-13T09:42:33.912014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Small leak can sink a great ship–boost rl training on moe with icepop!","venue":null,"work_id":"399e2d21-5486-4ddc-9419-8b8d3ebf58e9","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:47afb979b69249ea703cfd299d7ec81c84b8813ea1a8e35911b38f1347398a4d","observation_id":"8b232ab9-5f0a-47da-a982-e7ab8a5792f7","resolution":{"observed_at":"2026-05-13T09:42:33.908495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.01374","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:48:39.913120Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices.arXiv preprint arXiv:2512.01374, 2025a","venue":null,"work_id":"2881a661-1c4c-4e66-abba-aa3a176aadff","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:3bfed9e76d6d550cd8f1d7dce5ca7944ede179cc68683e927a93a0bf1a7b1411","observation_id":"c7831df4-df25-4f4c-a67b-36852ae4c24b","resolution":{"observed_at":"2026-05-13T06:02:23.496418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:756a7ef92fafe85de92d6602cf13fbf3cf1303da2411b3e57b92bef7ba8916ec","observation_id":"9238bbf6-a52f-46fe-991e-3fdacb4541c9","resolution":{"observed_at":"2026-05-13T06:02:23.552263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T03:08:21.960036+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01161","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.214162Z","title":"Prosperity before collapse: How far can off-policy rl reach with stale data on llms?","venue":null,"work_id":"99a02056-55bc-45e6-8d10-7f31cf541473","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:c1634ed0023640b79a5cc3018a9d7b38ea4f4342c8adef548f940f762a3ebf02","observation_id":"806f8306-3f5d-4164-bd7e-59b441558a1c","resolution":{"observed_at":"2026-05-13T06:02:23.499553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37:62557–62583","venue":null,"work_id":"889462de-9d24-4aac-8847-18d7f5ed8899","year":2024},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:a3035033e4ed093ed414a0f90e3ab7a5c899206b4b728dfd5e1e8a4cc633d3e4","observation_id":"b9b6f318-4fad-404f-ac68-15a895208590","resolution":{"observed_at":"2026-05-13T09:42:33.906563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Limitations","venue":null,"work_id":"ac677dc7-1823-4cf9-82e4-b64c72e1d6f3","year":2025},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:24a6bc5c1df41276276612991ef53be26ade857cbfcc931d7e8e863887670824","observation_id":"5a4380e2-768b-4371-8664-b6fae4aaf663","resolution":{"observed_at":"2026-05-13T09:42:33.904611Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Therefore IRB approval is not applicable","venue":null,"work_id":"7b446810-4b26-459e-8019-36ee1cee724b","year":null},"citing_paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T05:57:49.286939Z"},"links":{"citing_paper":"/paper/2605.12070"},"observation_digest":"sha256:b42ad683f02cc8b96bc27bc3468381d16cf92cfcd4ffa9f4b571f67db4d88b27","observation_id":"66624dd4-4111-4234-8af2-517fe92cdfea","resolution":{"observed_at":"2026-05-13T09:42:33.913667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.12070","last_updated":"2026-05-12T12:57:55Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T01:18:34.156920Z","submitted_at":"2026-05-12T12:57:55Z","title":"Missing Old Logits in Asynchronous Agentic RL: Semantic Mismatch and Repair Methods for Off-Policy Correction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":26,"verified_fuzzy":13},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2605.12070."}