{"as_of":"2026-08-09T04:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55626807b74237548ff908390a25722061313b5ad4f29dc53af6fdc58ba3a0b2","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:23:30.344213Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10481/citation-record","integrity":"/paper/2607.10481/integrity","json":"/paper/2607.10481/citation-record.json","paper":"/paper/2607.10481"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T07:23:23.928177Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:23.928177Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:1e5d92ff05946ca78dbe5078bccfc77a6defc0154d124f8c9d6e718d6e9b85f7","observation_id":"0e4e57c1-b755-49ca-a60a-fa13eeb3b440","resolution":{"observed_at":"2026-08-02T07:23:23.928177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.006590Z","title":"Nature , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.006590Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e8c853cc9f4d92f77670c9cc2383ee32e3931b2422a181a3b07cbd2561b75db4","observation_id":"450c0916-6b95-4f93-9157-9fdf49aee130","resolution":{"observed_at":"2026-08-02T07:23:24.006590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-02T07:23:24.088146Z","title":"2: Pushing the frontier of open large language models , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.088146Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:c3283bc3d3fe9f1dc317e244b41f0af9132fe9c264162c2ddb49e00411eb1736","observation_id":"e10c48c1-b611-4d29-88b3-ecf63eb507da","resolution":{"observed_at":"2026-08-02T07:23:24.088146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T07:23:24.173789Z","title":"arXiv preprint arXiv:2507.06261 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.173789Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:62f150fae7b367e81ddafd69dd437f5a45705d5673ddf5ef960600d509bde891","observation_id":"b2340d31-664f-444e-90bb-5f6515277157","resolution":{"observed_at":"2026-08-02T07:23:24.173789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T07:23:24.240938Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.240938Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0acbc209e94400115456741d5070ca52551d78668d6e855c7ef55558ca94cbe3","observation_id":"64a91aa6-9641-4b7c-8eed-7f521c90c960","resolution":{"observed_at":"2026-08-02T07:23:24.240938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-02T07:23:24.296105Z","title":"5: Scaling reinforcement learning with llms , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.296105Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:eb51393cfb96c24c8ed9d134f5da7e2403aa9efd425308c06c78951c9a87dd29","observation_id":"360b6a8f-6196-442f-b298-6d016242c44c","resolution":{"observed_at":"2026-08-02T07:23:24.296105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.367087Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.367087Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:dcd927919119c6a825459b13e8d91d36724f75e591c88d621213ae6dda0933fb","observation_id":"e7e73dca-5877-4ff9-be43-1fb21fe231ba","resolution":{"observed_at":"2026-08-02T07:23:24.367087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-02T07:23:24.456293Z","title":"arXiv preprint arXiv:2411.15124 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.456293Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:15df71e762fe41d13c494611ec56e76b2399cd2b217fa6193914d3f849363395","observation_id":"104fd3d2-3d38-4978-896d-7c756d512d2f","resolution":{"observed_at":"2026-08-02T07:23:24.456293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-02T07:23:24.544737Z","title":"arXiv preprint arXiv:2503.24290 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.544737Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9925bb42eedebcd1582c527b23d9ff2f946e1f29273dbe04ab471a9d8a5cf953","observation_id":"ac960a03-5beb-4333-ae8a-a92078c66deb","resolution":{"observed_at":"2026-08-02T07:23:24.544737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T07:23:24.608784Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.608784Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2c63330fa731298616dac63c51877a7863c45cedb090b5ff5a6ac6a33214ce96","observation_id":"cd2cf552-6097-47ec-87ef-e3049d793cd4","resolution":{"observed_at":"2026-08-02T07:23:24.608784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:24.718817Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.718817Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:4e6c14594e737c744c757472d9c6c3907c2b82eedc8f60565419ebba8d771d16","observation_id":"986de566-4ebb-4d99-add4-7fd0c747c883","resolution":{"observed_at":"2026-08-02T07:23:24.718817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-08T15:29:26.223468Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-02T07:23:24.802584Z","title":"arXiv preprint arXiv:1506.02438 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.802584Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:a2a380a9122c2cc4e933138d5c29cfa91db68778fb2dba9b7e044a67c8a05fa9","observation_id":"1def997a-e4da-48fa-b1cd-a2048e2d81e7","resolution":{"observed_at":"2026-08-02T07:23:24.802584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T07:23:24.906088Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.906088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2e38a04fa9f0105c5f1529e95d3bcefe886751085cd01c0a9995e1bbd571ecab","observation_id":"bf3897f7-3cf1-4dd2-8641-827a86680b12","resolution":{"observed_at":"2026-08-02T07:23:24.906088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-02T07:23:24.982944Z","title":"arXiv preprint arXiv:2503.14476 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:24.982944Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:04f85eaaf03d0e3ae0ebe347852a60450f4332661af5e4c444e811ef999f27da","observation_id":"9dca93f1-90c3-4970-bf38-5bce292e677c","resolution":{"observed_at":"2026-08-02T07:23:24.982944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-02T07:23:25.052567Z","title":"arXiv preprint arXiv:2503.20783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.052567Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9c1f06dddda5effc2d643fb65e5c80ac261697ff93fa4220129737686a3ca599","observation_id":"d398004d-dca2-4410-b88d-32b70387c35b","resolution":{"observed_at":"2026-08-02T07:23:25.052567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.055939Z","title":"arXiv preprint arXiv:2507.20673 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.055939Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:1ea63b94a581bcb696865e5a11551efb0f5972cce15644cf5c25ad5f984c3b52","observation_id":"56514245-048e-4c88-a373-e180751db1be","resolution":{"observed_at":"2026-08-02T07:23:25.055939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.058589Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.058589Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:8f05547fe335be2063c61a589edf2896375381bf88d1f3b9533a66d4b415ddde","observation_id":"8522327a-21c8-42ba-924a-983938f2330c","resolution":{"observed_at":"2026-08-02T07:23:25.058589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T07:23:25.134121Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.134121Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9a99628b6c08d69ab2cc6d0b00b10e6b159c1eaf42a3deba42015b2d2da97414","observation_id":"786d679e-0833-4e47-a0a1-ed845b8e4855","resolution":{"observed_at":"2026-08-02T07:23:25.134121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.298585Z","title":"Your Efficient RL Framework Secretly Brings You Off-Policy RL Training , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.298585Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0c912bb5739af6f06b01b74995065a49490ed2d3092a57640e96e1fe36a3ead1","observation_id":"1de4cc21-8ae0-4c05-b957-4778999137c0","resolution":{"observed_at":"2026-08-02T07:23:25.298585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.446955Z","title":"When Speed Kills Stability: Demystifying","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.446955Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:a25247bb80b253053c31643263e43c531f5555decb0848a6adece58afe8a83b0","observation_id":"e4c92e99-8e6f-4e18-a5d5-b5e39c27a706","resolution":{"observed_at":"2026-08-02T07:23:25.446955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.588238Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.588238Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:691a96f2fbd7820bc48464e516ecb047f9cedd9c3e4a41f1b2a72c82c59bdd52","observation_id":"8aaa4bc6-f4aa-421c-9d84-a588d0c4a3fb","resolution":{"observed_at":"2026-08-02T07:23:25.588238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.770620Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.770620Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:301734f99c7c55a3b84e7baff4f1afec844c5d06863bb7e6f106fa8c0593b7a3","observation_id":"c7960eeb-f82d-4099-8439-dedf72049e49","resolution":{"observed_at":"2026-08-02T07:23:25.770620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:25.894447Z","title":"Small Leak Can Sink a Great Ship--Boost RL Training on MoE with IcePop! , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:25.894447Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:18a82f8cf6994b14fe6194757c0fead19ba788d7d07b3cf547c231d92bb8f20e","observation_id":"4d271953-69c3-468e-ae90-1b7a0bc3e4af","resolution":{"observed_at":"2026-08-02T07:23:25.894447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.043996Z","title":"Reward Hacking in Reinforcement Learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.043996Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:51b3982bff3c7327751d45d12ab38ddb0fadf124485624041c3355fa1107539d","observation_id":"2bbb3002-cd38-4609-962a-455a163933af","resolution":{"observed_at":"2026-08-02T07:23:26.043996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.169322Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.169322Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:606627bcd9687364de8cd917f66c139d94814e6f2119aef671a32ea69356c91b","observation_id":"ce7b66e2-fe00-47f2-9e65-f8d5409ac127","resolution":{"observed_at":"2026-08-02T07:23:26.169322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.324565Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.324565Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:b1c73149fcff7bb11f020a12bfbcf513587e55ac56d45736d5151f650d3e9ef8","observation_id":"5181479d-b2d4-4764-b6a3-63147c4bdc3e","resolution":{"observed_at":"2026-08-02T07:23:26.324565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.485479Z","title":"arXiv preprint arXiv:2510.22543 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.485479Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:55774ee77b480696e1818e603b75afff938b87bd0c92b99665f5cbd99a7fcd6e","observation_id":"75e1e575-ceae-4910-b4be-8f1b294b5501","resolution":{"observed_at":"2026-08-02T07:23:26.485479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04664","last_updated":"2025-09-04T21:26:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-04T21:26:31Z","title":"Why Language Models Hallucinate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04664","snapshot_observed_at":"2026-08-02T07:23:26.610302Z","title":"arXiv preprint arXiv:2509.04664 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.610302Z"},"links":{"cited_paper":"/paper/2509.04664","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:6adf3887a23bf762845191c9cc9970177985c675ce4b2a68c331fe7a57fe3043","observation_id":"f6ee98a5-88fd-4b88-afd1-bd1fff59d1b6","resolution":{"observed_at":"2026-08-02T07:23:26.610302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.753190Z","title":"arXiv preprint arXiv:2509.09177 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.753190Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e87ac176ceb3d9e5af0b27aea88656c9fc503e68d88b0940c0a06b64e5a9394d","observation_id":"644ec384-f034-42a5-b532-3af159802735","resolution":{"observed_at":"2026-08-02T07:23:26.753190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:26.879211Z","title":"arXiv preprint arXiv:2508.17850 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:26.879211Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:340d605b488d82f23b9959bddf6b47fd6cfa2b01098b4f83454e3e50f1a45171","observation_id":"a1f20914-edae-452f-bf14-017970f5e5bf","resolution":{"observed_at":"2026-08-02T07:23:26.879211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.022813Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.022813Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:d3afb79c8ef00179289c51eaeca081146f41e8c07e5690a20474ef3053e5041f","observation_id":"c05e314c-dd90-4047-aaac-b1b841762423","resolution":{"observed_at":"2026-08-02T07:23:27.022813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.135881Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.135881Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:3c27dc3be33e1c44ffff0beb5a0ee55ee23fe130c6d3764f09ce4559eed99dae","observation_id":"0a741d53-da2c-4f08-9894-e3d11f428091","resolution":{"observed_at":"2026-08-02T07:23:27.135881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09477","last_updated":"2025-06-11T07:43:33Z","snapshot_observed_at":"2026-08-07T04:44:55.497491Z","submitted_at":"2025-06-11T07:43:33Z","title":"On a few pitfalls in KL divergence gradient estimation for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09477","snapshot_observed_at":"2026-08-02T07:23:27.338911Z","title":"arXiv preprint arXiv:2506.09477 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.338911Z"},"links":{"cited_paper":"/paper/2506.09477","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:088f6443f6e3dd3e514b339c5674203d17b76849a742641ca73e756f7fc8ffdd","observation_id":"52d4cd12-08db-4a46-9185-101a8416eb73","resolution":{"observed_at":"2026-08-02T07:23:27.338911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.495012Z","title":"arXiv preprint arXiv:2512.21852 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.495012Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:814ca8396b01f838e3e8fb2e55d9b1ee9e1f1e878243805b4d8d57ae58d9518b","observation_id":"8268c740-42ef-4ac1-8371-7bfda21e2a1e","resolution":{"observed_at":"2026-08-02T07:23:27.495012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.584045Z","title":"arXiv preprint arXiv:2510.20817 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.584045Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:33d679199e97adad22f98a5a4f02cf9d667f7a8114a955d644aefd6463c4d9b2","observation_id":"2250deb4-8107-49ac-9686-a8c2265794d8","resolution":{"observed_at":"2026-08-02T07:23:27.584045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.635901Z","title":"Beyond Reverse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.635901Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f9fd9410c1307d610734f41853dade160cff10d5f447d05f20769cd0e030d188","observation_id":"791ae013-e99d-4e5c-9fe0-14095100ee33","resolution":{"observed_at":"2026-08-02T07:23:27.635901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.740294Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.740294Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2c62ad7786f7166a05761030a152953dcfd174d41837ebdc9109d2ecb9fc3320","observation_id":"2a94f418-4dc3-47e1-900f-7c6878ac2504","resolution":{"observed_at":"2026-08-02T07:23:27.740294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.805767Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.805767Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:67c222fb35c90753ab8e58475a789d2094bf81d2221518cd0556bde550155282","observation_id":"4e73d123-5477-4d87-b305-e231911add6d","resolution":{"observed_at":"2026-08-02T07:23:27.805767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.878462Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.878462Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:89aefb2ed42ea1c5209aee56359d0840e9e697c07b362f44c035ef66be0abb0c","observation_id":"bf03e8f2-4be6-42ff-8570-0a3750bf6877","resolution":{"observed_at":"2026-08-02T07:23:27.878462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:27.968153Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:27.968153Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:a5b4eef1c5c831801c56a48021ad9470efd2151cdbdfbd7bdbf5998ab6229673","observation_id":"0af955a8-16ca-4abe-8d0d-10a7dafbf55a","resolution":{"observed_at":"2026-08-02T07:23:27.968153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-02T07:23:28.043198Z","title":"arXiv preprint arXiv:2505.22617 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.043198Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9e6d35432ed4d0d56abb9c9f4662afe5da5d7a1cc8c0fdf59b01f594e54bb864","observation_id":"7d932ad8-5103-4abf-8d8e-3a68b7e1d25b","resolution":{"observed_at":"2026-08-02T07:23:28.043198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.120890Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.120890Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:56b0a8803739532d79353dc725ceeae920905d67f97b5c289e2ce17846e099f4","observation_id":"a6f435ce-a6d7-4e87-9064-dc2720359b4f","resolution":{"observed_at":"2026-08-02T07:23:28.120890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.195301Z","title":"2023 , cdate=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.195301Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:fe66db96c1280ce2d2e5d9c9a25d201549de18a2fc7e9344e0dbb286fc9a8eaf","observation_id":"12a94e09-3547-486a-90a6-3ad997509fb6","resolution":{"observed_at":"2026-08-02T07:23:28.195301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-02T07:23:28.266130Z","title":"arXiv preprint arXiv:1909.08053 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.266130Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e1040a21da04657c670a51ffdfcc7894f61606f539af338ed21d65221d31eea6","observation_id":"cfdfc1eb-6ad9-477e-8379-337302f35f1e","resolution":{"observed_at":"2026-08-02T07:23:28.266130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-02T07:23:28.362049Z","title":"arXiv preprint arXiv:2504.14945 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.362049Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:78ed15f23c75368eb040c1960dbd19ee5dc7b3e7ca554de127117c95b3625851","observation_id":"53f87756-ad26-448a-93e4-ff1191eadeb9","resolution":{"observed_at":"2026-08-02T07:23:28.362049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.452592Z","title":"arXiv preprint arXiv:2506.07527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.452592Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7774d64a818a50934f46a011f8c29f730c9a9807272cc7eeb2d6e2a7e867898e","observation_id":"7de04c6c-5efd-4ba3-ab2a-02f49bb48455","resolution":{"observed_at":"2026-08-02T07:23:28.452592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19767","last_updated":"2025-06-24T16:31:37Z","snapshot_observed_at":"2026-08-06T23:00:22.849455Z","submitted_at":"2025-06-24T16:31:37Z","title":"SRFT: A Single-Stage Method with Supervised and Reinforcement Fine-Tuning for Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19767","snapshot_observed_at":"2026-08-02T07:23:28.545828Z","title":"arXiv preprint arXiv:2506.19767 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.545828Z"},"links":{"cited_paper":"/paper/2506.19767","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:93174a58fb529959ea00d55185efe153faa0ac7ded49f035269cc192fad76662","observation_id":"e7b7907b-ccc5-4b9b-be3f-b7943ba9f25f","resolution":{"observed_at":"2026-08-02T07:23:28.545828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.622105Z","title":"arXiv preprint arXiv:2509.04419 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.622105Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:0d2c3fd9a6391a7425959eabd5feb4d2547ba9e83405e2cc136af5ea74335194","observation_id":"ebad1479-c453-443e-9776-30c06c72f2f6","resolution":{"observed_at":"2026-08-02T07:23:28.622105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09340","last_updated":"2025-06-11T02:44:10Z","snapshot_observed_at":"2026-08-08T13:48:32.149553Z","submitted_at":"2025-06-11T02:44:10Z","title":"RePO: Replay-Enhanced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09340","snapshot_observed_at":"2026-08-02T07:23:28.717603Z","title":"arXiv preprint arXiv:2506.09340 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.717603Z"},"links":{"cited_paper":"/paper/2506.09340","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f2445c141d5cc870c250bee5bd8fff83b2b90413a18aa438146039428dcf6fb8","observation_id":"35b8c770-1527-4917-8fb3-60869d0916a8","resolution":{"observed_at":"2026-08-02T07:23:28.717603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06892","last_updated":"2025-07-11T10:32:34Z","snapshot_observed_at":"2026-08-08T01:13:16.846990Z","submitted_at":"2025-07-09T14:29:45Z","title":"Squeeze the Soaked Sponge: Efficient Off-policy Reinforcement Finetuning for Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06892","snapshot_observed_at":"2026-08-02T07:23:28.818300Z","title":"arXiv preprint arXiv:2507.06892 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.818300Z"},"links":{"cited_paper":"/paper/2507.06892","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7b1f983f2483060aaf350a3e16eeaa0c55261acd5823b476f55becb5af553883","observation_id":"a6ba5694-badf-4fad-8793-20ff8e40f96b","resolution":{"observed_at":"2026-08-02T07:23:28.818300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:28.913789Z","title":"arXiv preprint arXiv:2510.02245 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:28.913789Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e292b0378da2f6ee5045c23e9144cf49780f0fd6595a9db2a5637face10e7294","observation_id":"eb6a0f3c-58e8-49d2-94f5-7c88251d8adf","resolution":{"observed_at":"2026-08-02T07:23:28.913789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.07451","last_updated":"2025-07-10T05:58:55Z","snapshot_observed_at":"2026-08-06T18:38:08.639641Z","submitted_at":"2025-07-10T05:58:55Z","title":"RLEP: Reinforcement Learning with Experience Replay for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.07451","snapshot_observed_at":"2026-08-02T07:23:29.013207Z","title":"arXiv preprint arXiv:2507.07451 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.013207Z"},"links":{"cited_paper":"/paper/2507.07451","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f0e0665d6ac8a0f61fbc7599f90a4bd10a148c14838ff03f8ebe32ff4b3acf8f","observation_id":"e769e426-7214-4d05-bd84-4105242bdd2e","resolution":{"observed_at":"2026-08-02T07:23:29.013207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04140","last_updated":"2026-07-01T03:04:05Z","snapshot_observed_at":"2026-08-07T12:12:30.927049Z","submitted_at":"2025-10-05T10:38:55Z","title":"Selective Expert Guidance for Effective and Diverse Exploration in Reinforcement Learning of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04140","snapshot_observed_at":"2026-08-02T07:23:29.108343Z","title":"arXiv preprint arXiv:2510.04140 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.108343Z"},"links":{"cited_paper":"/paper/2510.04140","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:7503cfb6bd9917be4e23f06fa59784d45fe0a4dc2abe2403970781d351c9f48b","observation_id":"f7fe8cac-6531-4408-99c4-1bd10dd168f0","resolution":{"observed_at":"2026-08-02T07:23:29.108343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.154734Z","title":"arXiv preprint arXiv:2510.03865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.154734Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:f4cda9243b796de567f35986a8947e2d10818ae72dbb3f3d6aa7c79422afe37a","observation_id":"8577ebe5-249b-4800-bb18-c975f86e57a1","resolution":{"observed_at":"2026-08-02T07:23:29.154734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.245333Z","title":"arXiv preprint arXiv:2509.07430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.245333Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:d98e14dc9cb96b704ece214843439125f91884fd9a51d1e621cf3cec21a2e4f1","observation_id":"44e25a45-8a51-4105-a098-e97129606755","resolution":{"observed_at":"2026-08-02T07:23:29.245333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.404192Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.404192Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:2678c466dfe470a1fff6f7d9ef7af11cc622f4a83c2b4511889283f1bd3df443","observation_id":"dd617188-aaca-41c7-8cff-f6e816320646","resolution":{"observed_at":"2026-08-02T07:23:29.404192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-02T07:23:29.526424Z","title":"arXiv preprint arXiv:2601.02780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.526424Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:40c4e11b08aa6e3a3608eb88d51ee505a5187470936ddf3196014e985a7f52f2","observation_id":"9b022685-e7d2-4fbb-aa66-842bfd501e22","resolution":{"observed_at":"2026-08-02T07:23:29.526424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.693770Z","title":"arXiv preprint arXiv:2603.22117 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.693770Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9f7e9a88ad20dbb47d85d9b62bf328cea4f843dafcf2cf3ab45593930c601a49","observation_id":"28cdf359-2843-4333-b14d-b21f1a92d30f","resolution":{"observed_at":"2026-08-02T07:23:29.693770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.817926Z","title":"arXiv preprint arXiv:2603.19835 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.817926Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:e4c6b6d35515db9d5cf8e48666b5c69b30833ef79bcfab7d059ba81f5bfde83e","observation_id":"682775fd-3a03-44a7-aa4c-dab4e66ddea5","resolution":{"observed_at":"2026-08-02T07:23:29.817926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T07:23:29.943795Z","title":"arXiv preprint arXiv:2603.22446 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:29.943795Z"},"links":{"citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:9cc3d5527259877a776fcff0e02d93ad770af5a975dd5bd47854d7eb3f32c3b5","observation_id":"06234128-6f8c-46a4-a1cf-4929522df424","resolution":{"observed_at":"2026-08-02T07:23:29.943795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30420","last_updated":"2026-07-22T12:19:38Z","snapshot_observed_at":"2026-08-03T05:15:47.643397Z","submitted_at":"2026-06-29T15:05:28Z","title":"Experience Augmented Policy Optimization for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30420","snapshot_observed_at":"2026-08-02T07:23:30.079906Z","title":"arXiv preprint arXiv:2606.30420 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.079906Z"},"links":{"cited_paper":"/paper/2606.30420","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:ab3413692574b08732dfa08f9adf7f2e861c1f4a63510132aa9f91117084ce11","observation_id":"79e6168e-577f-4be5-ba8a-bb1cfab2dcca","resolution":{"observed_at":"2026-08-02T07:23:30.079906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22156","snapshot_observed_at":"2026-08-02T07:23:30.215870Z","title":"arXiv preprint arXiv:2605.22156 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.215870Z"},"links":{"cited_paper":"/paper/2605.22156","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:fdccba5be4e44e4276cfd6e12ad3fa5d615b09058ee1b4cdadcca267f3717e0a","observation_id":"9b5031bc-8e80-4294-bedd-c73a5983a727","resolution":{"observed_at":"2026-08-02T07:23:30.215870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22703","last_updated":"2026-05-21T16:45:31Z","snapshot_observed_at":"2026-08-02T07:15:58.729767Z","submitted_at":"2026-05-21T16:45:31Z","title":"Clipping Bottleneck: Stabilizing RLVR via Stochastic Recovery of Near-Boundary Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22703","snapshot_observed_at":"2026-08-02T07:23:30.344213Z","title":"arXiv preprint arXiv:2605.22703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-02T07:23:30.344213Z"},"links":{"cited_paper":"/paper/2605.22703","citing_paper":"/paper/2607.10481"},"observation_digest":"sha256:1ac42c72bd4e65b00f5cda5b596fb40a76a1e49978655f83e394ba8ca372ce22","observation_id":"50e9359a-fb92-42cc-a5c2-a388db996a82","resolution":{"observed_at":"2026-08-02T07:23:30.344213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10481","last_updated":"2026-07-21T15:48:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T05:55:01.460326Z","submitted_at":"2026-07-11T21:22:46Z","title":"ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2607.10481."}