{"as_of":"2026-08-18T18:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:312fa76462684324ef16ccb0b783c815d7ab6225138d418004929c0df1ed2bec","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:36:34.322864Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18722/citation-record","integrity":"/paper/2607.18722/integrity","json":"/paper/2607.18722/citation-record.json","paper":"/paper/2607.18722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:31.831428Z","title":"Staleness in fully asynchronous RL.https://appliedcompute","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:31.831428Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:fa4841d72a47920f369f8eab63a392c6fc59d8eb11a5cb4fcc4c315f31b55bbb","observation_id":"e6413e05-596f-4d37-be35-57411ae27a57","resolution":{"observed_at":"2026-08-01T14:36:31.831428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-01T14:36:31.937887Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:31.937887Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:4a822e796d4f96a1b9dca6032ffa20ce398473d94699a9e234991dc718084e33","observation_id":"b6cb9c57-9e63-4c53-bf68-528e5929e1b8","resolution":{"observed_at":"2026-08-01T14:36:31.937887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.058621Z","title":"Kpop: Taming training–inference mismatch in reinforcement learning with adaptive masking regions, May 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.058621Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:b705cb0da2304e86ee70701c3130eca5a4f99603f6bbf97c0e84dc2dda9dfabe","observation_id":"b8b5cc90-592b-426c-b6ce-460b27712920","resolution":{"observed_at":"2026-08-01T14:36:32.058621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07508","last_updated":"2026-07-08T15:02:19Z","snapshot_observed_at":"2026-08-13T17:31:55.182872Z","submitted_at":"2026-07-08T15:02:19Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07508","snapshot_observed_at":"2026-08-01T14:36:32.203143Z","title":"Single-rollout asynchronous optimization for agentic reinforcement learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.203143Z"},"links":{"cited_paper":"/paper/2607.07508","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:e23c54b27fe90f04770a67af3d1ebbf535a0058a129e3dcaa722c74b9f32fcf0","observation_id":"884b4557-7dad-476e-b828-55a4aa438cee","resolution":{"observed_at":"2026-08-01T14:36:32.203143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.304147Z","title":"Stabilizing rlvr via token-level gradient diagnosis and layerwise clipping, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.304147Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:f55cfdf011c32bee203405f05eefc61117427200ae2004e38a7682d70e5dff1d","observation_id":"64398b4c-f0f4-4f83-89fe-d0e1a2fdda98","resolution":{"observed_at":"2026-08-01T14:36:32.304147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.449198Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.449198Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:cb32128636c81b43a26696278fd39a76939b58fa10b8cab59039f746b3cd5d20","observation_id":"a46f3cb1-3564-4238-98fa-791a20249e55","resolution":{"observed_at":"2026-08-01T14:36:32.449198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.634733Z","title":"Stabilizing MoE reinforcement learning by aligning training and inference routers.arXiv preprint arXiv:2510.11370, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.634733Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:bf5f24e306455c98e459d5d634ada4249c7e7006766ec1d71089a70c0e687da3","observation_id":"2cae68bc-4ccf-4684-b76f-fa09566df595","resolution":{"observed_at":"2026-08-01T14:36:32.634733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:32.845639Z","title":"Rethinking the trust region in LLM reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.845639Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:d9e4f9372965bc7719b1b333de58678c30b87e2683e130928f6015bb5a509f8a","observation_id":"3c811da1-d109-4b48-9278-e72bb60c6bfb","resolution":{"observed_at":"2026-08-01T14:36:32.845639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-01T14:36:32.958394Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:32.958394Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:dac1ca31c12da0d40d51210f476735dd5fa8f4a29f4d9a52495239449d61b3f7","observation_id":"738ca189-9408-4045-8f74-1be796585e9f","resolution":{"observed_at":"2026-08-01T14:36:32.958394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T14:36:33.084469Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.084469Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:2221b00679784b2a6a5e88bca9401901b98614f02e53f410cf133e34c82e9c1d","observation_id":"beec5b53-d5e2-4e73-ba9e-d12b235f85f8","resolution":{"observed_at":"2026-08-01T14:36:33.084469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T14:36:33.192530Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.192530Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:e871d2f9f4f610f1eb460e708f0ca3175f045979cf94087c34ecb85125bd0c08","observation_id":"0d9e1a7f-c816-4895-ab79-cb4bbabb0842","resolution":{"observed_at":"2026-08-01T14:36:33.192530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-01T14:36:33.391991Z","title":"Megatron-LM: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.391991Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:5f7824d33d8922a85a4eabac02bb3fc91059d8d07a72cb56ae5d2a91307d1454","observation_id":"be9955a2-bf4f-4a54-a983-4bc8373cd7d4","resolution":{"observed_at":"2026-08-01T14:36:33.391991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T14:36:33.544666Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.544666Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:dbaab0dc099fa75d027ac54e2c985ac8b6998ff8e501e4602a6cea8db477952e","observation_id":"5d1bd3b8-31c6-4612-af43-5d8203e0db37","resolution":{"observed_at":"2026-08-01T14:36:33.544666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09821","last_updated":"2026-06-08T17:58:23Z","snapshot_observed_at":"2026-08-14T16:40:34.220617Z","submitted_at":"2026-06-08T17:58:23Z","title":"Rethinking the Divergence Regularization in LLM RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09821","snapshot_observed_at":"2026-08-01T14:36:33.642069Z","title":"Rethinking the divergence regularization in llm rl.arXiv preprint arXiv:2606.09821, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.642069Z"},"links":{"cited_paper":"/paper/2606.09821","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7ef73207619bad51607a82a5393017157efcd5612205da51376b0183b876c5cf","observation_id":"b288e0a7-fbd5-4981-9ec2-f356ff9bcba6","resolution":{"observed_at":"2026-08-01T14:36:33.642069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.791105Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.791105Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7078131e59915cf650ac89494c1a2cbf0eaab80166d0b90408dfab98f7bb5bd4","observation_id":"2da0c69c-9f37-48ac-9d82-5b7cfe2ab2e5","resolution":{"observed_at":"2026-08-01T14:36:33.791105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.909133Z","title":"Small leak can sink a great ship–boost rl training on moe with icepop!, Sep 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.909133Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:7b9646ac99f9b4ef78e7f669c6b30bca5c21c75d8ca79d0a07db14b86bf63480","observation_id":"1e6148d5-599a-405e-8982-b49caa7c7880","resolution":{"observed_at":"2026-08-01T14:36:33.909133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:33.995325Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:33.995325Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:458c7cefe035e775c28e41aa1e43fe4f77374a5005bf30d0cf9ae00b797cd2cf","observation_id":"12399fa0-bf49-48f4-9c37-add1d4c02137","resolution":{"observed_at":"2026-08-01T14:36:33.995325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T14:36:34.082604Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.082604Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:a9c69a33346460a92a3544e81f62552d0ba61170c9d3eb215c5880e5ba56c196","observation_id":"21e3219c-4068-4cba-a11e-089608d7fb36","resolution":{"observed_at":"2026-08-01T14:36:34.082604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-08-18T16:18:58.765617Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-01T14:36:34.155714Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.155714Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:b3a1a6fbcb9ee40cef9e1184d8aa4aedc0527cfb1516644364b2d260646f04be","observation_id":"b8d1cb8a-44e8-445d-8086-f3b1bc2763ca","resolution":{"observed_at":"2026-08-01T14:36:34.155714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:34.238953Z","title":"X yt µ(yt |s t) π(yt |s t) µ(yt |s t) −1 # = 2ξ TX t=1 Est∼µ h 2DTV(µ(· |st)∥π(· |st)) i = 4ξE y∼µ","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.238953Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:b7cc6923d7ee0e45418c0b2ce07a31f26adc56ddbd2dc9a9945233ee575b015e","observation_id":"b3d1f6f7-a2c5-44b6-a836-00045af49020","resolution":{"observed_at":"2026-08-01T14:36:34.238953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:36:34.322864Z","title":"This is consistent with a sampledDTV gate improving stability on the reported stack, but it does not explain the remaining gap toSAT-GSPO w/ R3 or even toSAT-GRPO w/ R3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:36:34.322864Z"},"links":{"citing_paper":"/paper/2607.18722"},"observation_digest":"sha256:4ae2fb96cfc34436126595a75556fd1913ffa1d9a7cb35d7afcbaf48f09dbfba","observation_id":"fd5ebb47-0db7-44c1-b13d-b11f3608725d","resolution":{"observed_at":"2026-08-01T14:36:34.322864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18722","last_updated":"2026-07-24T17:06:56Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T05:21:48.333896Z","submitted_at":"2026-07-21T05:27:50Z","title":"Stale but Stable: Staleness-Adaptive Trust Regions for Stabilizing Asynchronous Reinforcement Learning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2607.18722."}