{"as_of":"2026-08-10T01:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15e9f5fc3134b8610ed236b1d18a4415f0d0967974971f81814f07c0d0fc02bd","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T08:49:37.615924Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10848/citation-record","integrity":"/paper/2607.10848/integrity","json":"/paper/2607.10848/citation-record.json","paper":"/paper/2607.10848"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:928e727524c763c662bfe73a37dec981120e67696f9eff1712b7cc3c6e86fcd3","observation_id":"68551c4e-dc65-4aed-bdb1-f151fabf8187","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:ecd8d0758c01e7fbdb21e34628a11d757a7508eea1e341b406a5964cd82ac7b4","observation_id":"52ac8a75-1c16-4bfe-a1ca-1fa17084e47c","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms 11 via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:40102a1f05d90f92b75d0fecb8b9d975cc199049f3e92e76924c2485400d3094","observation_id":"906cac7a-da9c-4681-b459-2d42a2f87604","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"https://thinkingmachines.ai/blog/defeating-nondeterminism-in- llm-inference/","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:b3bbeacff82402926b2920247e01066e417c379ab0883c716a8ecd04b483d7f2","observation_id":"a6deee50-f3d8-42a3-8e35-22a2bb1d132e","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"When speed kills stability: Demystifying rl collapse from the inference-training mismatch, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:10d24a17ed73bdf80cf66ea39d1a94b103c5d98e65b85fa4fa0315de274f1989","observation_id":"f6c6f435-b655-48f1-9fec-eb2b48ee8b53","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10968","last_updated":"2026-06-10T17:30:04Z","snapshot_observed_at":"2026-08-03T17:01:38.792809Z","submitted_at":"2026-06-09T15:09:29Z","title":"Beyond Uniform Token-Level Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10968","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Beyond uniform token-level trust region in llm reinforcement learning.arXiv preprint arXiv:2606.10968,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2606.10968","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:79b47dd60009043b5519ae2a265727567ba273b6dabd0c8a943975be7f249e57","observation_id":"0eb8cef3-6fd1-42ae-b224-2feaf23564c4","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Defeating the training-inference mismatch via fp16.arXiv preprint arXiv:2510.26788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:ee8480884d19e80b136d567b6551e7273ca8466acd80b00582b1a204b4d40a11","observation_id":"70c6814d-7b83-431a-8c00-a43aeddf6ae4","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04879","last_updated":"2026-05-26T12:42:28Z","snapshot_observed_at":"2026-08-06T18:09:15.279966Z","submitted_at":"2026-02-04T18:59:04Z","title":"Rethinking the Trust Region in LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04879","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Rethinking the trust region in llm reinforcement learning.arXiv preprint arXiv:2602.04879,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2602.04879","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:1956ae8f528e1cd479ba1a07ef69f3e7c2314ec1b16bb2355151a422a7104d24","observation_id":"f0215ada-3e65-4c29-8cd0-763b780cc13d","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:5bba2c8bda09d8ad5f985d336d67097321254889588a794fdbc24e93d3d4fbda","observation_id":"a31a58da-a056-41e9-8ed3-7d959e170055","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:799c7304a141c7283c98e936137350b74d514efa9abf4790d06099f799f424d1","observation_id":"9b62590e-aeb5-47dc-8912-7f00e983fdd1","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:27605ef3fc2c4e3774607d5c6da2a60db903d39aac45fed4a82bffe76b0d7b64","observation_id":"5423e8eb-5d03-4520-bb39-c284be433c82","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:33116387f940f58f2c9a63d1cf87f48655c3331bfed521406931fc88433493c7","observation_id":"7fa69b9c-a5e3-4df8-9ea9-5222a7380d00","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Kimi k1.5: Scaling reinforcement learning with llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:2a18ed29276a714d342f80653641842098fe0c91effc6d4ecc109fcdf5b86dd5","observation_id":"d28266e3-e8ba-4885-91e6-b672dc761455","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16025","last_updated":"2025-07-26T13:04:47Z","snapshot_observed_at":"2026-07-06T17:21:46.980522Z","submitted_at":"2024-01-29T10:17:54Z","title":"Simple Policy Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16025","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Simple policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2401.16025","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:a9d13ff1808c92a893a2cc841d7239bf11760b324b4da10ca0a06401ce84b3af","observation_id":"ff94ef2b-28cd-49bc-9af9-e63f2b4be31b","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:bdc827ffd20dda98bc722c5c9df3b226f5989976a32c84b279def82bf3f6069f","observation_id":"45e72984-97cd-420a-8b54-9113b30ba513","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09821","last_updated":"2026-06-08T17:58:23Z","snapshot_observed_at":"2026-08-08T12:06:44.701968Z","submitted_at":"2026-06-08T17:58:23Z","title":"Rethinking the Divergence Regularization in LLM RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09821","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Jiarui Yao, Xiangxin Zhou, Penghui Qi, Wee Sun Lee, Liefeng Bo, and Tianyu Pang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2606.09821","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:3ed1c0da6884f53e12e0156e5e7d00407fc6e2c1ccd4b792775c59b767e9a368","observation_id":"5861436c-563c-4e29-9d3e-c224264a6331","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:b934e43241bbe368e773c4cbcf0f01d766cf1d389bfb074b8572d756b81f5471","observation_id":"335fd98d-8447-453d-adf1-5664ee146f3d","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Stabilizing reinforcement learning with llms: Formulation and practices.arXiv preprint arXiv:2512.01374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:e5132f794a67ebfe2e557b227ddd56a6b67b40fd1afca281b3b429ce49f5b0de","observation_id":"a80c74fc-c51f-4766-a16c-9c8c9ee4f54c","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-07T21:57:36.964068Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Reinforcing general reasoning without verifiers.arXiv preprint arXiv:2505.21493, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:488df3dfec0f4c9683d06c67f418ced5774f6db53c0231d982f84d934fc8ed10","observation_id":"1c040be7-4644-4a71-ad7a-08c77ae88e6e","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:59834675d5b016292a5f6750a9445b44eeca617a3319f3f9c9e98beb5e09872c","observation_id":"d701038e-e666-4992-8d4a-dd92dcb8800c","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"GRPO (Shao et al.,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:67a66afe16e69c45097bd9cf8ec5726584221614a2708cf9cba5aec1000a0152","observation_id":"722c673d-87a4-41cb-9887-8a4da861ba9a","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:a64edb073160121da9c796e2cb7a8f97d123ac3526f42ee295eb58aa9491819f","observation_id":"6cfebd66-a1dd-4f1a-b6ab-4a7422b3d5ea","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"These methods modify the objective or the clipping rule, but they still decide the update direction from the sampled importance ratio","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:ba9f629b794ddf44b8b9025ccd7454c50655f767bcaf106f5f45c44e805aa05b","observation_id":"7dd4f3d8-062a-4429-92f4-e9cca86232e2","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"(5) that we build on","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:b39467695df54f016bd3f28b09c0bb99d60311f49f55d0384573dfd55f0fd713","observation_id":"0bb1750d-f617-4116-8345-fc7dadec84cf","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Aggregated-tail estimator.Under the top-K aggregated-tail construction, the support contains the retained tokensK and one tail bucket","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:9373fa57462f89f0db5f3f7d2f514c8ab5b44bad04d06712019128e538d52f2f","observation_id":"38072ebf-d0b6-44c5-bc05-9d4b3b38beb3","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"By default, both training and rollout use BF16","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:a57f5266e7a40e70c83d7c158fac2460631a9238dd9eaafd7be961f11c5653d1","observation_id":"7ee75953-0c84-48f1-b679-d164f04cf47b","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:42606cc83862c8a33d0ed99be43a0a120b721ebe54d21b6332274f239f6850f1","observation_id":"a6836379-670c-4122-b8d1-2462534f9de2","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T21:58:25.575773Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.10848."}