{"as_of":"2026-08-23T06:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6fd357d92c08d10d101b23a5d7c5ba1b472fef42de6cab1659e52672bf5aac94","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:23:02.622661Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00455/citation-record","integrity":"/paper/2608.00455/integrity","json":"/paper/2608.00455/citation-record.json","paper":"/paper/2608.00455"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.194943Z","title":"Real-time reinforcement learning for composer","venue":null,"work_id":"db6fe73e-7201-47cc-8d5b-7fa7572659ca","year":null},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.524661Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:72f9c6e90210d90e0f75fb4b45c177922473c14747e691998ba3f94722bd46d9","observation_id":"87ac05cc-0bc8-47c7-9ac4-658f77604162","resolution":{"observed_at":"2026-08-15T15:23:03.199496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-08-09T10:40:08.574574Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":2},"cited_work":{"arxiv_id":"2607.01120","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.01120","snapshot_observed_at":"2026-08-15T15:23:03.017178Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","venue":"cs.DC","work_id":"6f0dfa85-ee13-4029-9996-d7792a8eada3","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.533029Z"},"links":{"cited_paper":"/paper/2607.01120","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:cb00e2b3414a0ae799735592530c2df9ad9b4268bbaedb57146f136cb0a067d6","observation_id":"27628c50-99db-4e9e-b6b1-99b8c1f46a50","resolution":{"observed_at":"2026-08-15T15:23:03.021885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:02.537534Z","title":"ProRL Agent: Rollout-as-a-service for RL training of multi-turn LLM agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.537534Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:4598ea478303d8e1483541191b6806de0ca136307bc0fcbf3fa582ae25fb0548","observation_id":"9376c251-19d5-4556-a222-771bab938de5","resolution":{"observed_at":"2026-08-15T15:23:02.537534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.173103Z","title":"RollArt: Disaggregated Multi-Task agentic RL training at scale","venue":null,"work_id":"db14173a-153e-4e62-a188-5b97c270ac6a","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.541308Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:04d1307f1a3cad6d72fd1bdf65a731cdc4d23ad8b75e5528d141fd59a890760d","observation_id":"27e87b0f-4d8e-408e-ae44-4e2dffbba69f","resolution":{"observed_at":"2026-08-15T15:23:03.177185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:02.545196Z","title":"Rollout-training co-design for efficient llm-based multi-agent reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.545196Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:a5e85c6562084fd029bda55da542b2207a9f14d07c27c6c5cead8ef940dda997","observation_id":"c31e978f-7f91-4a81-b236-2660151a972d","resolution":{"observed_at":"2026-08-15T15:23:02.545196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03839","last_updated":"2026-05-19T16:03:06Z","snapshot_observed_at":"2026-08-17T11:19:27.233176Z","submitted_at":"2026-02-03T18:56:48Z","title":"Understanding and Exploiting Weight Update Sparsity for Communication-Efficient Distributed RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.03839","snapshot_observed_at":"2026-08-15T15:23:02.549141Z","title":"Understanding and exploiting weight update sparsity for communication-efficient distributed rl","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.549141Z"},"links":{"cited_paper":"/paper/2602.03839","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:1f1c490d82a8d33b0e3b59b1284926251324257e1a13c20eb3fbf16f2b882663","observation_id":"cfd0eaa0-e3c6-4adf-8550-14ff79b74b66","resolution":{"observed_at":"2026-08-15T15:23:02.549141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11456","last_updated":"2026-08-04T08:12:37Z","snapshot_observed_at":"2026-08-21T16:33:39.184701Z","submitted_at":"2026-02-12T00:26:53Z","title":"AuroraRL: Fast, Fault-Tolerant, and Cost-Efficient Reinforcement Learning over Decentralized Network","version":2},"cited_work":{"arxiv_id":"2602.11456","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.11456","snapshot_observed_at":"2026-08-15T15:23:02.877983Z","title":"AuroraRL: Fast, Fault-Tolerant, and Cost-Efficient Reinforcement Learning over Decentralized Network","venue":"cs.DC","work_id":"ff5b2604-3847-4bbe-8076-82ea90cfff8c","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.553385Z"},"links":{"cited_paper":"/paper/2602.11456","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:b679398703ed26195d5502cb5a96fb84c1dcac8d544985b3ee0c8d83a2b00f63","observation_id":"aff6792a-6898-4c3f-ad61-9fd9613697b0","resolution":{"observed_at":"2026-08-15T15:23:02.884699Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.161665Z","title":"ByteCheckpoint: A unified checkpointing system for large foundation model development","venue":null,"work_id":"49ef53df-bbcf-4850-aa7b-6c9f5183643d","year":2025},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.557094Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:019110916b87752b55e943f69233205d867305ec5a4e4c9abd87145e28f80a2b","observation_id":"c4fd0578-3dc6-4fac-bc5f-d59d9226abbb","resolution":{"observed_at":"2026-08-15T15:23:03.165793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.150678Z","title":"HybridFlow: A flexible and efficient RLHF framework","venue":null,"work_id":"4664e342-5569-4346-99d4-3c4dda382ab2","year":2025},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.560505Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:e6ae723c387b59f731245b77c9a3ad86d1226fa51aa4ba49df7670acc70b7f78","observation_id":"8fc109bf-49fe-41e2-b220-4cf006fa3b73","resolution":{"observed_at":"2026-08-15T15:23:03.154803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.139661Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":"8f37c629-3bb8-4116-8e55-74806aa98076","year":2024},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.563927Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:07e86a2dabf2f5af56a4515d2e51663a95cc490df7639d9a035cc1652811d893","observation_id":"d4fa7514-51fd-4a6f-85b5-a417ef8a5703","resolution":{"observed_at":"2026-08-15T15:23:03.143619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01481","last_updated":"2024-09-03T05:47:42Z","snapshot_observed_at":"2026-08-22T07:14:03.354331Z","submitted_at":"2024-05-02T17:13:40Z","title":"NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01481","snapshot_observed_at":"2026-08-15T15:23:02.567717Z","title":"NeMo-Aligner: Scalable toolkit for efficient model alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.567717Z"},"links":{"cited_paper":"/paper/2405.01481","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:7c462116158ed702dbd7f83f849baf0f60e728a8e84117878a6af35e094ea091","observation_id":"bd125550-762a-42f9-85cd-1566e98f3969","resolution":{"observed_at":"2026-08-15T15:23:02.567717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-08-13T17:30:05.303052Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-08-15T15:23:02.572250Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library .arXiv preprint arXiv:2506.06122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.572250Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:0f1d58d659ad92e467ebfe46054ab0b3f3031bf6f16f79fe32a271fb71eab521","observation_id":"aa50c4a5-d853-4991-90d0-6dc8df4729a0","resolution":{"observed_at":"2026-08-15T15:23:02.572250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.127192Z","title":"Areal: A large-scale asynchronous reinforcement learning system for language reasoning","venue":null,"work_id":"edb7e7aa-e3c7-41e3-98e6-439bb19bf5e8","year":2025},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.576111Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:27b49c6c2671dd1bdf47f0c0d5cc57ec55231fabd4b5bf35c9d9de5d43770d8d","observation_id":"b506897d-387b-46a3-81e0-ef940679a0b9","resolution":{"observed_at":"2026-08-15T15:23:03.131802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26256","snapshot_observed_at":"2026-08-15T15:23:02.579866Z","title":"DORA: A scalable asynchronous reinforcement learning system for language model training","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.579866Z"},"links":{"cited_paper":"/paper/2604.26256","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:a8b4ff9b3a12a15739a519deca658f0a2a0ae2914354de0782089f9ef6bc737c","observation_id":"ce30214d-06b0-46ee-b380-92a1c2411c92","resolution":{"observed_at":"2026-08-15T15:23:02.579866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:02.584658Z","title":"Laminar: A scalable asynchronous RL post-training framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.584658Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:e8919b0f7462d1c838ee20c0e69200d0f2fa3f5f1dc5547a2a77495d46351217","observation_id":"403052df-cb3d-4144-90fd-302660ec2b96","resolution":{"observed_at":"2026-08-15T15:23:02.584658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.115519Z","title":"Weave: Efficient co-scheduling for disaggregated RL post-training","venue":null,"work_id":"f3a97a61-e8dd-4387-8110-11b816a415b8","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.588181Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:a9efdec4d70c15008a769b5a11b45f87a43e8d722ff1a1e1871b03cf0c053f3c","observation_id":"8e42b59f-1c56-403c-a6ca-62037aa51f5f","resolution":{"observed_at":"2026-08-15T15:23:03.119730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-15T15:49:31.621402Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06534","snapshot_observed_at":"2026-08-15T15:23:02.591636Z","title":"ROSE: Rollout on serving GPUs via cooperative elasticity for agentic RL","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.591636Z"},"links":{"cited_paper":"/paper/2605.06534","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:d87150ae8501b8111f277db1f144eb835e0e4eec2c9268239ed94697b929aeb1","observation_id":"a9c310d6-661b-4110-982f-e8536a440bad","resolution":{"observed_at":"2026-08-15T15:23:02.591636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.102741Z","title":"Efficient large-scale language model training on GPU clusters using Megatron-LM","venue":null,"work_id":"9eb90b7e-2af2-43d6-a0bf-3ebe6fee9c34","year":2021},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.595352Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:6babb9a7bfb50d58164fb76a3cf9c25a9b5e9a1e9ab136ec31addb99543d54c8","observation_id":"143163f9-60b5-40fb-ad8b-46674e79b591","resolution":{"observed_at":"2026-08-15T15:23:03.107261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-15T15:23:02.598663Z","title":"PyTorch FSDP: Experiences on scaling fully sharded data parallel","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.598663Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:87f7677c48b5f7395cff93a95989036872ee993b94022ad1ab34db2696f5edce","observation_id":"cd610275-790d-4e3d-b699-41817f960c22","resolution":{"observed_at":"2026-08-15T15:23:02.598663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.091600Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"eabe93c5-55e1-41a1-9a3b-f7cb8a3f48a8","year":2023},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.602183Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:7589d5238b4e7b9c4b6a889eed5dcd4b3b5077419595f2990f04f4883be223d7","observation_id":"f107140e-5967-44c9-aed3-e0e26b20d03b","resolution":{"observed_at":"2026-08-15T15:23:03.095600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.080277Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":"a73e7436-1fb1-47af-b544-9a370ebaf653","year":2024},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.605639Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:877de510bed8af1bad22c5862f13c874a2c5f89b1c50fbdec73f996f0d6a7a1c","observation_id":"63c92526-3054-498f-b7c7-842eeb2e804c","resolution":{"observed_at":"2026-08-15T15:23:03.084282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.067744Z","title":"Universal checkpointing: A flexible and efficient distributed checkpointing system for large-scale DNN training with reconfigurable parallelism","venue":null,"work_id":"f36dcb3a-d2dd-436d-9684-5a078709c112","year":2025},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.608865Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:44233e136b982cb0230f7a427ccdc8f1c5d8be7cc3035a18ad15c4e2aec95b3e","observation_id":"e0d55182-edf2-40af-95f0-ab1ef602376d","resolution":{"observed_at":"2026-08-15T15:23:03.071907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.09107","last_updated":"2026-04-10T08:40:56Z","snapshot_observed_at":"2026-08-11T13:05:24.098808Z","submitted_at":"2026-04-10T08:40:56Z","title":"TensorHub: Scalable and Elastic Weight Transfer for LLM RL Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.09107","snapshot_observed_at":"2026-08-15T15:23:02.612335Z","title":"Arpaci-Dusseau, and Remzi H","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.612335Z"},"links":{"cited_paper":"/paper/2604.09107","citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:6f6a91685e202d07ff734ccda09fd58269f39665a31218ae80dc5399fa4e1b16","observation_id":"1307dfa1-5828-4323-884a-207f0631f272","resolution":{"observed_at":"2026-08-15T15:23:02.612335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.055919Z","title":"slime documentation: Delta weight sync","venue":null,"work_id":"1f230a47-25a0-4e0d-ab46-d567dacf2aa0","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.615881Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:6d12ec01d32d83c6d28e52974601f68bc482940bd58606f5e973e284bfcae88d","observation_id":"12da2c2c-ee1b-4b57-b944-1223a9d627d0","resolution":{"observed_at":"2026-08-15T15:23:03.060359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.043258Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"c859082d-a3ee-4079-9013-80efb3d9d5f7","year":2019},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.619090Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:50497bc797f56a25aaaaf74ce529ad3b3beb65ca8cc03883705409f85c970518","observation_id":"013515be-e6f6-43d8-ac3c-12f64398677f","resolution":{"observed_at":"2026-08-15T15:23:03.047711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.030019Z","title":"B MCore and Hugging Face Parameter Layouts This appendix explains why AREAL-DTE performs change detection after conversion rather than directly in the optimizer-native MCore layout","venue":null,"work_id":"bd082d92-a304-47f2-9c0d-1d2bd0ae79ea","year":null},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.622661Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:6957662903e0264867a520c2f1f739c21dda9b86a1a3e88d403aac10feae71c4","observation_id":"5496ea2d-e461-463b-b753-21e702b42580","resolution":{"observed_at":"2026-08-15T15:23:03.034644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:23:03.183873Z","title":null,"venue":null,"work_id":"9010085b-6249-4d79-90bc-54231008b100","year":2026},"citing_paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:23:02.529401Z"},"links":{"citing_paper":"/paper/2608.00455"},"observation_digest":"sha256:661e65ab85f0f9979ee8000f19ec9894ba3c65769f67dad782416f31f035f658","observation_id":"5abc359d-5e05-44a1-a157-4732438a5572","resolution":{"observed_at":"2026-08-15T15:23:03.187794Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.00455","last_updated":"2026-08-01T05:34:56Z","latest_version":1,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-20T12:34:46.513233Z","submitted_at":"2026-08-01T05:34:56Z","title":"AReaL-DTE: Sparse Policy-Weight Transfer for Online Agentic Reinforcement Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":10,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2608.00455."}