{"as_of":"2026-08-12T17:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:33693cd082cb1f9cf0687ebb205b7b05543195a67f34164d9605c5ef2edb1856","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:50:27.321310Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:25:47.686864Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2510.19225","last_updated":"2026-04-08T03:04:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-22T04:19:37Z","title":"RLBoost: Harvesting Preemptible Resources for Cost-Efficient Reinforcement Learning on LLMs","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:29:46.136115Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2510.19225"},"observation_digest":"sha256:bf0c1625f3177e1bbc6e7e4c21e8aa6a1393edca52b5b27bdfd3c30d41b46c75","observation_id":"112883d0-6887-4de7-b4b7-899ef8ca68e7","resolution":{"observed_at":"2026-05-18T05:30:55.233504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2511.14617","last_updated":"2026-04-03T12:47:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T16:12:21Z","title":"Seer: Online Context Learning for Fast Synchronous LLM Reinforcement Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T20:38:30.169363Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2511.14617"},"observation_digest":"sha256:6c85831e5cda8f4d8df02028eef3bb654c97b2490c8621e96a5a1b16d11b2c3d","observation_id":"e9b06d53-e5f5-4e41-9b5e-403dca8629c6","resolution":{"observed_at":"2026-05-17T20:40:14.617800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2512.12476","last_updated":"2026-04-11T14:05:07Z","snapshot_observed_at":"2026-08-12T11:22:44.594256Z","submitted_at":"2025-12-13T22:20:51Z","title":"HetRL: Efficient Reinforcement Learning for LLMs in Heterogeneous Environments","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-16T22:21:26.271796Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2512.12476"},"observation_digest":"sha256:54bfa714c8cbb82d9802b3e867bf9e56ace42812f0ef753131cd05e3fb225e07","observation_id":"d8dc7989-1236-4404-b95e-0304c517592d","resolution":{"observed_at":"2026-05-16T22:23:36.609296Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-04T06:25:47.686864Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.12784","last_updated":"2026-08-03T13:09:30Z","snapshot_observed_at":"2026-08-07T13:32:11.544592Z","submitted_at":"2026-01-19T07:31:32Z","title":"StaleFlow: Staleness-Aware Data Management for Mitigating Data Skewness in Fully Disaggregated RL Post-Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T06:25:47.686864Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2601.12784"},"observation_digest":"sha256:0a63afc6f606552beabae583b5337053b83580ba40db255c22f18ef9753ab502","observation_id":"b50643ea-e6e5-4f20-be01-0a8656750e66","resolution":{"observed_at":"2026-08-04T06:25:47.686864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-08-09T12:36:17.368609Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:7a3edc4154895e93da9556d975737bf68f53dba53ee1e2b4683ad2fa04efae20","observation_id":"aa820f69-54c1-4543-b167-7b144dec4266","resolution":{"observed_at":"2026-05-11T09:16:03.252155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T13:49:26.560459Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2604.26256"},"observation_digest":"sha256:6379808e9b073340c4d0665c1f58856dd59804483fefb2d43907be46b26c4c73","observation_id":"142c572d-7691-4260-bd9b-efbdd2b314eb","resolution":{"observed_at":"2026-05-12T08:46:26.399814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T05:14:14.168753Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:df254deb6a0cdf19e2ed57d1c4c4202f27efba5eec09151d69976a2389e2cf8f","observation_id":"02b03954-e67d-4f80-adf2-bf1dac632cf3","resolution":{"observed_at":"2026-05-11T21:31:16.373227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.06534","last_updated":"2026-05-20T11:37:51Z","snapshot_observed_at":"2026-08-03T06:43:16.351179Z","submitted_at":"2026-05-07T16:33:40Z","title":"ROSE: Rollout On Serving GPUs via Cooperative Elasticity for Agentic RL","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T08:39:31.911497Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.06534"},"observation_digest":"sha256:7dea309fc4492bf4de7d0ba4e2b99c30b9f53279867a4497dc455da879e1a435","observation_id":"e5ed996a-e8b6-4c17-a9f2-f131e885f42d","resolution":{"observed_at":"2026-05-21T08:39:53.267980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T19:25:12.407148Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:79a078913a3ff9df4f5316255bfce0a19ef1d8391ceada7302346476b5b91923","observation_id":"7fd5f89f-ebde-480c-a3f4-259cb86ab766","resolution":{"observed_at":"2026-05-14T19:27:51.833929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.13779","last_updated":"2026-05-26T16:10:31Z","snapshot_observed_at":"2026-07-06T23:25:21.032938Z","submitted_at":"2026-05-13T16:59:08Z","title":"MinT: Managed Infrastructure for Training and Serving Millions of LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T21:47:00.295144Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.13779"},"observation_digest":"sha256:92bdf38c34cf02e0b359787ac1f9a6a34fadb9be4870edd5685b2c53a5589751","observation_id":"07f10be1-22ce-4888-9fc8-dde4daa2ccfe","resolution":{"observed_at":"2026-07-01T14:15:47.696815Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.15565","last_updated":"2026-05-15T03:13:35Z","snapshot_observed_at":"2026-08-03T02:43:16.115285Z","submitted_at":"2026-05-15T03:13:35Z","title":"AstraFlow: Dataflow-Oriented Reinforcement Learning for Agentic LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T20:10:32.300423Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.15565"},"observation_digest":"sha256:514ee9b507b0d135387f6fefb41c336bb31ff2302b0d354fc9468dff49ad9728","observation_id":"5140c882-4a16-4283-816c-bda3d05ccc19","resolution":{"observed_at":"2026-05-20T20:13:43.849930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.17570","last_updated":"2026-05-17T17:58:53Z","snapshot_observed_at":"2026-07-06T23:28:36.134614Z","submitted_at":"2026-05-17T17:58:53Z","title":"How Off-Policy Can GRPO Be? Mu-GRPO for Efficient LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T13:38:45.835754Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.17570"},"observation_digest":"sha256:b5a96e509db50d6ae4bf6df7cb85e3a241a75fd44e58ee51771bd00cb424ef35","observation_id":"5fb59008-1636-4372-8235-f9d306f9a9b2","resolution":{"observed_at":"2026-05-20T13:43:19.691995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.18799","last_updated":"2026-05-11T09:22:39Z","snapshot_observed_at":"2026-08-12T12:04:30.856151Z","submitted_at":"2026-05-11T09:22:39Z","title":"ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T22:51:56.666980Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.18799"},"observation_digest":"sha256:11fa32dbbfcf69cb0495b5cf768cc4e2530f6541757f844e82e1573acd06feb0","observation_id":"fe86fbfa-8b18-45b9-8d92-33878cb828f3","resolution":{"observed_at":"2026-05-20T22:53:49.316129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2605.30859","last_updated":"2026-05-29T05:31:46Z","snapshot_observed_at":"2026-08-02T08:45:30.158970Z","submitted_at":"2026-05-29T05:31:46Z","title":"DARTS: Distribution-Aware Active Rollout Trajectory Shaping for Accelerating LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T23:25:30.618655Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2605.30859"},"observation_digest":"sha256:798ad7a4f8aca3b18e1aef3b1744725ea6c57b0457fbfb9d0a9e7777e4078890","observation_id":"5e9395cb-3585-40f2-b4a6-27a8ef09b296","resolution":{"observed_at":"2026-06-28T23:42:50.076818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:a7c828e48e0bc2810a62dbd74a2a1cede3b945c64f6ec05af72570ca4bb988d1","observation_id":"fbe8a96f-2990-4848-a2b2-9f89cd11061f","resolution":{"observed_at":"2026-07-02T02:16:27.236287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-08T02:18:13.870572Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:eebe2a11be919509bae2668ec14896a1fc658097882d41c19df5431075bb1126","observation_id":"5eadce32-87bd-4b68-8033-954ea52c09eb","resolution":{"observed_at":"2026-07-02T06:06:41.103700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.05597","last_updated":"2026-08-07T17:58:32Z","snapshot_observed_at":"2026-08-12T17:11:17.830262Z","submitted_at":"2026-06-04T02:18:44Z","title":"AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T02:45:25.694378Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.05597"},"observation_digest":"sha256:213f2ac380d33c8dbf11663ae3d5b8bc36faf39eb91a37ab51aff6ca79a747c3","observation_id":"70f1faaf-3161-4540-b063-df5709732fff","resolution":{"observed_at":"2026-07-02T11:56:55.539212Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.11867","last_updated":"2026-06-10T09:42:11Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T09:42:11Z","title":"Harnessing Routing Foresight for Micro-step-level MoE load balancing in RL Post-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T08:35:16.435272Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.11867"},"observation_digest":"sha256:1b8be731076e3b4ce09b87427a086a6ef0bb71755745f030403fad19700879f4","observation_id":"734f7b0c-1948-4dbc-9cd5-a481f9d412b5","resolution":{"observed_at":"2026-07-03T13:08:07.825413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-04T14:50:42.006804Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T02:56:47.102678Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:292f91b8c4822a62c871b9c238af3c957bfa85012862c1003b43e5cd79bf2f55","observation_id":"0d02a00d-56ed-4e2c-b7fe-a080d8207836","resolution":{"observed_at":"2026-07-04T14:39:58.206846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-07-12T11:52:35.159984Z","title":"arXiv preprint arXiv:2507.01663 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.26997","last_updated":"2026-07-05T07:05:22Z","snapshot_observed_at":"2026-08-04T14:50:42.006804Z","submitted_at":"2026-06-25T13:14:14Z","title":"RolloutPipe: Overlapping Pipelined Rollout and Training in Disaggregated On-Policy LLM Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T11:52:35.159984Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.26997"},"observation_digest":"sha256:a2b1a1424a6b30412099664ab24f76d5aa19955a76e0b118826fd9a78d1f25af","observation_id":"c8d59ed5-d847-4c63-880f-f18e47cd6fab","resolution":{"observed_at":"2026-07-12T11:52:35.159984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-01T06:07:48.137351Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:77c8b8c4cf47cfdddd81bed214334330bfea5c61159680ee31dee53351dbe046","observation_id":"5877e01e-d11e-4464-b7a4-a984069db35e","resolution":{"observed_at":"2026-07-01T09:55:40.366622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-02T19:37:49.661596Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:d6d090ee5fa2e2b2fdb40ef1a5447a84743bb999242e83eb10969e9e0a6d4df9","observation_id":"0db74f64-680d-48b0-b7fe-65a4b2be6f17","resolution":{"observed_at":"2026-07-02T19:47:18.967406Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-08-09T10:40:08.574574Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-02T05:58:39.107614Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2607.01120"},"observation_digest":"sha256:14412efdbc2839d2e0d8437f1091ec8af60af320ab347c1ceb67065aff1057f5","observation_id":"26631df4-64db-4f0d-b912-66c3a50368e8","resolution":{"observed_at":"2026-07-02T06:06:40.588456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":"2507.01663","doi":"10.48550/arxiv.2507.01663","metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Asyncflow: An asynchronous streaming rl framework for efficient llm post-training","venue":"ArXiv.org","work_id":"c78dd69f-0c92-450b-8e2b-dec1ded07146","year":2025},"citing_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-08-09T10:40:08.574574Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T18:47:46.719344Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2607.01120"},"observation_digest":"sha256:1ff35c908708c2384fe475203bd0f2fb299b9574cb08d0ffd2c6880104f49cbe","observation_id":"17173bbf-93a2-485d-9c69-c7d3c3888201","resolution":{"observed_at":"2026-07-03T18:48:49.549581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-01T06:48:17.927596Z","title":"arXiv preprint arXiv:2507.01663 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-07T09:56:42.250730Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:17.927596Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:7bdbef2d401e4deab9784478ef4115e0961d1b6741c6327c94ad6f197dbf3e2b","observation_id":"ecca540d-4d77-4e58-825e-2fe83203497b","resolution":{"observed_at":"2026-08-01T06:48:17.927596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01663","snapshot_observed_at":"2026-08-02T11:13:59.835182Z","title":"2025.AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22614","last_updated":"2026-06-15T09:41:09Z","snapshot_observed_at":"2026-08-07T04:23:01.926858Z","submitted_at":"2026-06-15T09:41:09Z","title":"DynaResize: Runtime GPU Reallocation for Disaggregated LLM Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T11:13:59.835182Z"},"links":{"cited_paper":"/paper/2507.01663","citing_paper":"/paper/2607.22614"},"observation_digest":"sha256:2c75ac05675ded05f0392b87f63b881383df10d9d44d3a70d2d1ce7657b25663","observation_id":"b2a7c890-de8e-43d3-bd39-5f0139bbfee1","resolution":{"observed_at":"2026-08-02T11:13:59.835182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01663/citation-record","integrity":"/paper/2507.01663/integrity","json":"/paper/2507.01663/citation-record.json","paper":"/paper/2507.01663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:23.371559Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.371559Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:e14ae7df972f5b14d79dfda30a7bc9fb46db2c2454cfe1a2427ed89a9276e872","observation_id":"46d25ce1-454e-462c-9377-3301bde54e64","resolution":{"observed_at":"2026-08-06T20:50:23.371559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24298","last_updated":"2026-03-02T03:07:29Z","snapshot_observed_at":"2026-08-02T16:10:09.199211Z","submitted_at":"2025-05-30T07:18:25Z","title":"AReaL: A Large-Scale Asynchronous Reinforcement Learning System for Language Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24298","snapshot_observed_at":"2026-08-06T20:50:23.494922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.494922Z"},"links":{"cited_paper":"/paper/2505.24298","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:4b50be82a70cbb63a3fab43fa42f31e22f5a392cf66c629e2bdb2193c95990b2","observation_id":"25fd9d1c-33a4-4ccf-a6da-17df1b42fefa","resolution":{"observed_at":"2026-08-06T20:50:23.494922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:50:23.607624Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.607624Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:af74cf09308a6f3042e57cea33d8d971709d09c741f97ce15650f250575a881f","observation_id":"f7203b3a-c107-475e-b8e1-9e0910873f3f","resolution":{"observed_at":"2026-08-06T20:50:23.607624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:50:23.665168Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.665168Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:ac3ebacad4fe2620892331113b773b211ca6b15a8ae25206f924851bb25b2a6e","observation_id":"a0732c1e-7d82-46fa-9315-dafcb233f0d7","resolution":{"observed_at":"2026-08-06T20:50:23.665168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-06T20:50:23.746801Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.746801Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:9ad390def67d08b0a855babcb833c4f450370e7759cb5e5e8dbbf7122b455ec9","observation_id":"80fb76fe-ead1-463c-8e3d-ee0f7e495574","resolution":{"observed_at":"2026-08-06T20:50:23.746801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:29.833120Z","title":null,"venue":null,"work_id":"93371d5f-2385-4c88-aedf-c0fa37d3aa6a","year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.792867Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:59c4743c01cb33d876728bf2e969175f93ced7844538dc5a25707af59f4e9c99","observation_id":"a79ecafe-0d75-4b7c-950b-71108f40717d","resolution":{"observed_at":"2026-08-06T20:50:29.912904Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T20:50:23.874031Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.874031Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:b652f318fd86fd51f8324a58e66686958d9a7958d3fc6193268a7655b13562f6","observation_id":"2ad2fbd3-3560-4f40-8ab5-1010dd2a2e52","resolution":{"observed_at":"2026-08-06T20:50:23.874031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:23.957925Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.957925Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:746ff143318c71cecd42a25d108f5d197140529eeae3c5b114496be96b739b73","observation_id":"f09dd7b3-549b-431f-b04a-a31ebd8d291e","resolution":{"observed_at":"2026-08-06T20:50:23.957925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:24.065421Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.065421Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:0659f7b1233c1bcae67aa8ae42c625b71cc72e750f80f6f4aaa0b63832596488","observation_id":"74e4220d-f0af-4d0e-a4be-2fe238d87203","resolution":{"observed_at":"2026-08-06T20:50:24.065421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:29.668847Z","title":null,"venue":null,"work_id":"b7a35705-2764-4e64-b864-96d7fb20dd1e","year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.156477Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:34ea1666ecde00140e5e90b8bdc90ef533a809100a7555bee03e2fd71d1cd24e","observation_id":"674824de-c49a-4757-9637-54cbf24ba8d6","resolution":{"observed_at":"2026-08-06T20:50:29.714425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:29.467325Z","title":null,"venue":null,"work_id":"239813fd-870d-4fed-b0ca-6ef7c639c5ad","year":2018},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.218086Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:7b61eed70d47219ced83c65a10c283d1864cca412fd08469cbc3161b36f1e43d","observation_id":"c8d743e4-2213-4201-9c76-e6fbe33c5ec6","resolution":{"observed_at":"2026-08-06T20:50:29.553919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:29.178212Z","title":null,"venue":null,"work_id":"d01e828d-c11a-44a0-a689-65d6847dd1e8","year":2023},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.278951Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:12acde844c61dbb8b5e2f9fce949c10d62ba01fa52439e8d4a1b9e3da799e552","observation_id":"40a3b82f-c831-48d5-905d-c10856c2bc05","resolution":{"observed_at":"2026-08-06T20:50:29.326392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18252","last_updated":"2025-04-26T08:33:32Z","snapshot_observed_at":"2026-08-07T20:55:15.330079Z","submitted_at":"2024-10-23T19:59:50Z","title":"Asynchronous RLHF: Faster and More Efficient Off-Policy RL for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18252","snapshot_observed_at":"2026-08-06T20:50:24.360887Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.360887Z"},"links":{"cited_paper":"/paper/2410.18252","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:aa78502e0827637a8c6cd78fc3c051d1ac74d1354bfa70ce28449d7ad1d2d4df","observation_id":"07827dcc-bfb5-406f-a29f-092f44660d04","resolution":{"observed_at":"2026-08-06T20:50:24.360887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.981655Z","title":null,"venue":null,"work_id":"9e421dcd-2566-469e-af69-0954c2fdf5a0","year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.447740Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:0943117f04817e926a9196340e148494debfc8acfc570b81310b2bd5ddd275e4","observation_id":"5f817e66-21bc-43ab-8815-03a983158915","resolution":{"observed_at":"2026-08-06T20:50:29.081753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.740227Z","title":null,"venue":null,"work_id":"b951187b-8d88-4aa1-abf5-0f7b64144b58","year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.516808Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:7335d3d959b3ad5d4a938f943e9b7fbf83b0ed8fd12d6acf5199c7051763cfeb","observation_id":"b881e1ae-495a-4272-aaee-8ff7520d7b75","resolution":{"observed_at":"2026-08-06T20:50:28.837815Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.560139Z","title":null,"venue":null,"work_id":"893fa716-f84b-4169-94ea-9b1c2ce7b569","year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.620637Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:824b6b09edac40e35dc984a1e5aae26492885a5b254abf5f2e6f9371495254ea","observation_id":"ccf5a5af-748e-4608-93cd-8532bbe885d9","resolution":{"observed_at":"2026-08-06T20:50:28.651324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:24.688080Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.688080Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:f6653e0cdfbf17dcb687a8dff4f8d523166405d9689d038a24ba7d629a72b908","observation_id":"618f94f3-488e-40ad-b4b3-0aea79d23918","resolution":{"observed_at":"2026-08-06T20:50:24.688080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.395766Z","title":null,"venue":null,"work_id":"776f77aa-0266-476b-9350-726d86a9a5b9","year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.786808Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:f4dbd89083f31223876c3ff1a4693a33ecf5b17fe06302eee4c19be13b5d646d","observation_id":"0607598d-493e-46e9-9ed5-54c69a5d74ad","resolution":{"observed_at":"2026-08-06T20:50:28.440328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:24.864671Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.864671Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:08c748d87e981ab8fd2980046a724d99d5d667e530c11efb8c928bb2a7d823c2","observation_id":"1c8586b4-dbb9-4c65-acce-9ff28e26f768","resolution":{"observed_at":"2026-08-06T20:50:24.864671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.159693Z","title":null,"venue":null,"work_id":"f14fe55d-ad74-4a62-a1ae-4f5b280cdaad","year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.072760Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:b16442110e5570c8aaeddf417f5e4af79f219270d659c18f7b3b6c9474861c62","observation_id":"97cc7667-20c7-4030-b100-c3add74a8985","resolution":{"observed_at":"2026-08-06T20:50:28.293480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:25.128106Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.128106Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:c20e978025f6960a1403a3be1aadf4786d699ff0a923466d8233776942035a3b","observation_id":"4d1b0e6b-801c-467e-a4ff-7864b72735d1","resolution":{"observed_at":"2026-08-06T20:50:25.128106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:27.859662Z","title":null,"venue":null,"work_id":"719032d9-b7b0-45f9-a971-ef347ae11cc9","year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.339509Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:e2f329848c54d783182b51a9bb61ee4f5a844ee02645005ec81de02c450d4412","observation_id":"c49c1376-9549-438b-bc4a-5a4ad49df465","resolution":{"observed_at":"2026-08-06T20:50:27.961261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T20:50:25.455913Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.455913Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:0eec34c4af9a79f397b2def4ac77da206a3bdacb4109bd4d701a1c424fc0eff5","observation_id":"ab346954-7fe8-4b53-8eae-3d7d42dbbb68","resolution":{"observed_at":"2026-08-06T20:50:25.455913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:27.713091Z","title":null,"venue":null,"work_id":"23818d67-7009-4487-ae19-726a2081cf94","year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.569447Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:c1d287bc39f2821609c962206e0c6c7cd030e5faab30d48d456e0ca36c0eea18","observation_id":"9f378172-e836-47a0-8822-e2ac5b12ffd2","resolution":{"observed_at":"2026-08-06T20:50:27.787781Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:27.636174Z","title":"Failures","venue":null,"work_id":"aed0c259-ef63-4a42-be64-fce563980959","year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.798723Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:ef8b760464474296f134f6b4f0fa2ce76b4a94d38177188b8c4b6dbd0be24566","observation_id":"4095aa0f-07fd-428f-bc95-a0731145e58a","resolution":{"observed_at":"2026-08-06T20:50:27.676300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01481","last_updated":"2024-09-03T05:47:42Z","snapshot_observed_at":"2026-08-04T02:02:52.136893Z","submitted_at":"2024-05-02T17:13:40Z","title":"NeMo-Aligner: Scalable Toolkit for Efficient Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01481","snapshot_observed_at":"2026-08-06T20:50:25.927351Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.927351Z"},"links":{"cited_paper":"/paper/2405.01481","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:8acae03c2d65c7d532f85e22683bdfb7aa6fc3fa76db03eb5d8d01d4d13ffa3a","observation_id":"bf7613ef-81f8-41ae-b7c2-09a9db61ff12","resolution":{"observed_at":"2026-08-06T20:50:25.927351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T20:50:26.079285Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.079285Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:d9b1d345dd5d7961d44e8b4e9b24b22930f67513a97a8107b6cf41ef72b28425","observation_id":"97127d98-7e6f-4f2f-933e-0f8146da3870","resolution":{"observed_at":"2026-08-06T20:50:26.079285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T20:50:26.227947Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.227947Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:d9259ff559d866d6e438f5b40afb8b0fd3e83b02b133044beb54fa60405c4a40","observation_id":"d0baf46b-86d1-447c-a924-7becacfb272d","resolution":{"observed_at":"2026-08-06T20:50:26.227947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:26.305620Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.305620Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:0e71546ea45d893a9d42b706333426b82ab9b312c7a4deeb17a23f8a91a57591","observation_id":"9030c992-729d-42e2-be5c-fcade351f9f6","resolution":{"observed_at":"2026-08-06T20:50:26.305620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:26.511769Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.511769Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:81a5150cb939aca0d96c861c691168d5c271f238f0ec7083a769438dc24a414d","observation_id":"ac918cbe-5aee-4902-899c-03e4960e1a27","resolution":{"observed_at":"2026-08-06T20:50:26.511769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:26.581911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.581911Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:fafdc6418c48132aeb13339baaf6ac6962995cec419d761bf76698f11d410329","observation_id":"b5dbac13-b58b-4ff3-93cb-5e2a8209e6d9","resolution":{"observed_at":"2026-08-06T20:50:26.581911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:26.642772Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.642772Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:399342b131d6884bfef4246753eeda5de38ad2d84234851ba9db67ca578b4141","observation_id":"887a0eec-de12-4af9-a6d3-abc96c3e5988","resolution":{"observed_at":"2026-08-06T20:50:26.642772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T20:50:26.739168Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.739168Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:48604e6f20808bfb0dcdb4d2a721c509b3f3c218bb743e52b5d52f3e659b7dee","observation_id":"41c3d9df-d503-4f32-8a0d-1da3ce2ad636","resolution":{"observed_at":"2026-08-06T20:50:26.739168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T20:50:26.860137Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.860137Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:cea1c59df50bb347c5da1f719deac7d711c43eee901f23b7750d26d3528a4bf6","observation_id":"af31c308-b2e1-4a76-95c5-462a3662a1c5","resolution":{"observed_at":"2026-08-06T20:50:26.860137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01320","last_updated":"2023-08-02T18:49:57Z","snapshot_observed_at":"2026-08-12T12:08:28.008444Z","submitted_at":"2023-08-02T18:49:57Z","title":"DeepSpeed-Chat: Easy, Fast and Affordable RLHF Training of ChatGPT-like Models at All Scales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01320","snapshot_observed_at":"2026-08-06T20:50:26.921368Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.921368Z"},"links":{"cited_paper":"/paper/2308.01320","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:8df7c53c02bd6b82610e2689f63eda6604a69dc9a33c18f50a84e89aadd33c30","observation_id":"31e20e14-e2d7-48c2-8f4b-62ff40c7919f","resolution":{"observed_at":"2026-08-06T20:50:26.921368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-06T20:50:26.431436Z","title":"5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.431436Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:8b30546870d6a2245a8e4c3e5e2af0867a3745d0024253e21d526c1f29c3b60b","observation_id":"336620c9-d406-4233-9fa9-7ccc4be26cb2","resolution":{"observed_at":"2026-08-06T20:50:26.431436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-06T20:50:27.077348Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:27.077348Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:1aa36359871756b15ae7af1c4a287a1ac3a92b5007fb7715798781e889e81b7e","observation_id":"d1627376-5485-4466-9ac6-9fb3a0dfd156","resolution":{"observed_at":"2026-08-06T20:50:27.077348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:27.175348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:27.175348Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:14f372f3c22f20845c35cc141253d380e8f25ad07ae5c12ca1b2f701605b0981","observation_id":"306008ea-0040-4a94-9c65-d3e96f1d82dc","resolution":{"observed_at":"2026-08-06T20:50:27.175348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13221","last_updated":"2025-04-22T14:32:59Z","snapshot_observed_at":"2026-08-12T10:58:48.220129Z","submitted_at":"2024-09-20T05:15:38Z","title":"Optimizing RLHF Training for Large Language Models with Stage Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13221","snapshot_observed_at":"2026-08-06T20:50:27.321310Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:27.321310Z"},"links":{"cited_paper":"/paper/2409.13221","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:051d1bb1525065a2c8a844979288404ad9066f9ca27babe31a4c881a87439ea0","observation_id":"d98d3fa4-f2fb-43bc-8624-4a5357486934","resolution":{"observed_at":"2026-08-06T20:50:27.321310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T20:50:26.967552Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:26.967552Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:a49c16d783d4ead32c576ae042ac8613633892a24b06d48a0ee44316722bc595","observation_id":"6a96f4c5-531b-47c9-a19c-cab592f0391a","resolution":{"observed_at":"2026-08-06T20:50:26.967552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15930","last_updated":"2025-04-22T14:19:06Z","snapshot_observed_at":"2026-08-09T10:41:00.576345Z","submitted_at":"2025-04-22T14:19:06Z","title":"StreamRL: Scalable, Heterogeneous, and Elastic RL for LLMs with Disaggregated Stream Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15930","snapshot_observed_at":"2026-08-06T20:50:27.252236Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:27.252236Z"},"links":{"cited_paper":"/paper/2504.15930","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:deb3189c50adb40bc0997abf09b4f23c2cca02b53335deee8b663e6283798b10","observation_id":"eaef4a1d-b396-4be5-aee8-b1ce2379af6e","resolution":{"observed_at":"2026-08-06T20:50:27.252236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:24.942956Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.942956Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:459a1476c8d642a148d17be04b781615df4aebd8ab40912e4abf817513334251","observation_id":"220a39c8-4455-4acd-b1aa-286cbb58384e","resolution":{"observed_at":"2026-08-06T20:50:24.942956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:30.028572Z","title":"In Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers)","venue":null,"work_id":"6356eedd-d3f7-4593-a7fe-8bac70fca20e","year":2019},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:23.433779Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:9f9b7ad34dd7552761eab8b22c80c5e6b96b8315e531a1b84ec1529372e81482","observation_id":"be1ed4c8-e2e9-4bbc-9526-e6114914bca0","resolution":{"observed_at":"2026-08-06T20:50:30.107828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:28.024418Z","title":"In Proceedings of the 26th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":"9798132f-f44f-4fa9-9cb6-7480d0a317b7","year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.208410Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:bbe88a257902fdd1d9b64caeb211502853372a3e9d17da57c76eed33550807de","observation_id":"59707ba9-4d91-484e-bee0-7255cec5581c","resolution":{"observed_at":"2026-08-06T20:50:28.110993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:24.015891Z","title":"InProceedings of the 29th Symposium on Operating Systems Principles","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.015891Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:568aa44430ab6edde18b1d6c8061f56217ef3890ae8f25c25d1cd0a82d780325","observation_id":"6cffe258-befd-48e2-8203-2455ada3d065","resolution":{"observed_at":"2026-08-06T20:50:24.015891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-11T01:48:59.557045Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:50:24.102771Z","title":"arXiv preprint arXiv:2412.19437 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:24.102771Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:37fd197add351689bf7621d3c4fca20c85adc28143d2099137da1809ea9c3da4","observation_id":"8138910b-5d2b-4a48-a76e-c0a19af5ae47","resolution":{"observed_at":"2026-08-06T20:50:24.102771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:50:25.679520Z","title":"arXiv preprint arXiv:2504.13914 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T20:50:25.679520Z"},"links":{"citing_paper":"/paper/2507.01663"},"observation_digest":"sha256:e797664b315ff7b879fd472da2d3d0f90e7d6e4f2370ef2b189923c83fd25739","observation_id":"97590c31-4d1f-429a-976b-89cf88ae0970","resolution":{"observed_at":"2026-08-06T20:50:25.679520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01663","last_updated":"2025-07-02T12:45:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T04:10:37.358894Z","submitted_at":"2025-07-02T12:45:34Z","title":"AsyncFlow: An Asynchronous Streaming RL Framework for Efficient LLM Post-Training"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 26 inbound Pith citation observations for arXiv:2507.01663."}