{"as_of":"2026-08-11T01:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7022d713809a42de01b7163a3bb8f6e6a372980f566c0f7c9c0c90bdd8b20cc3","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:55:57.728078Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:47:16.744697Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T08:36:07.284835Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"cited_work":{"arxiv_id":"2505.20686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20686","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brantley, M","venue":null,"work_id":"4036af5c-060e-4240-816d-038f3eefa0d9","year":2025},"citing_paper":{"arxiv_id":"2510.08539","last_updated":"2026-05-07T17:44:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T17:53:41Z","title":"On the optimization dynamics of RLVR: Gradient gap and step size thresholds","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T08:34:36.543874Z"},"links":{"cited_paper":"/paper/2505.20686","citing_paper":"/paper/2510.08539"},"observation_digest":"sha256:bda60022d251ec1ed5e343a9fe250f48b8592bf629db3d7b85898364604a2b65","observation_id":"6349f898-48a5-4df7-a4d1-6431d7e0e02f","resolution":{"observed_at":"2026-05-18T08:36:07.288018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20686","snapshot_observed_at":"2026-08-03T19:38:19.340781Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T19:38:19.340781Z"},"links":{"cited_paper":"/paper/2505.20686","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:097fde846ddae7bb40f77a3d86a7315e09f1e1a87ce24d3b0233d43ad8a95b69","observation_id":"b6ff4adb-ef38-43aa-be2c-f7875be47739","resolution":{"observed_at":"2026-08-03T19:38:19.340781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20686","snapshot_observed_at":"2026-08-04T06:47:16.744697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.23310","last_updated":"2026-08-03T07:38:27Z","snapshot_observed_at":"2026-08-08T10:55:12.381857Z","submitted_at":"2025-11-28T16:09:28Z","title":"Variance-Aware Baselines and Adaptive Learning Rates for Reinforcement Learning with Verifiable Rewards","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T06:47:16.744697Z"},"links":{"cited_paper":"/paper/2505.20686","citing_paper":"/paper/2511.23310"},"observation_digest":"sha256:576eebc851488f5d845ae352aad6240936f08c6e0a4c879cd8599b09eb5806ad","observation_id":"62febf29-27b9-4adc-8355-6fec57b6f8b8","resolution":{"observed_at":"2026-08-04T06:47:16.744697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20686/citation-record","integrity":"/paper/2505.20686/integrity","json":"/paper/2505.20686/citation-record.json","paper":"/paper/2505.20686"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:00.212766Z","title":null,"venue":null,"work_id":"2e74065e-33ac-432a-b173-d87fdf3f4ade","year":2025},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.898779Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:94c050bd745915bdabb81a941eeb7d35f2dd3b6d3d7e45ec9f4c3253cdc50fcf","observation_id":"e81a2ab3-e7be-4a5c-b437-cf9bcd404833","resolution":{"observed_at":"2026-08-07T13:56:00.295544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.842551Z","title":"So,a2 = (−2)2 = 4","venue":null,"work_id":"f0ce8636-cb32-479a-a676-a6bd6ccfd31f","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.019407Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:c521a275b5a55736a5daa535cf89df32fa403683fcff2396122fff511b38aa25","observation_id":"66aec46c-8ef6-45f2-8d3c-ebff8e96057e","resolution":{"observed_at":"2026-08-07T13:55:59.902129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.594865Z","title":null,"venue":null,"work_id":"7de19f84-012e-4a74-a6bf-2acc2a3b922b","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.481389Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:7cc244084302bfa16e04e9b0f1f619558c9218843aac359328ed6d87ef6cf492","observation_id":"d84a8ba9-54ec-48b2-9408-3179fe2abd2e","resolution":{"observed_at":"2026-08-07T13:55:58.688420Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:56:00.015705Z","title":"So,1 b2 = 1 32 = 1 9","venue":null,"work_id":"ab3fef7a-ec87-4a9d-9beb-05afd8b63905","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.962513Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:7eb29b7eec272209f9062ea9f6709a9db9c5d7714dee7cfbe14d0d4ce7b45ca2","observation_id":"325b6916-991d-49d0-b391-836cad9fdfb5","resolution":{"observed_at":"2026-08-07T13:56:00.109577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.546887Z","title":"Since3≤b≤5 , the minimum value ofb is 3","venue":null,"work_id":"b3199752-aa57-484d-9934-4b60c69f4656","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.100364Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:0674f056410019b43590700e3765290d258c910ad4fde621ecb84b682410250c","observation_id":"5dc3bda0-7723-4f97-9ff4-08425c39f29a","resolution":{"observed_at":"2026-08-07T13:55:59.679835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:59.278971Z","title":"Since−6≤a≤ −2, the minimum value ofa2 is (−2)2 = 4","venue":null,"work_id":"cbfb8301-3286-479c-b29c-5acd87654646","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.174578Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:66f354e5be58c62c562829f1f5328bb2348f4f762e6ad49940d23b24944f4e9d","observation_id":"4af27d99-0b7b-4316-86b3-b1c4283560c3","resolution":{"observed_at":"2026-08-07T13:55:59.386030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.994212Z","title":null,"venue":null,"work_id":"edcf3ee6-2e9d-46d0-802c-e0ff693dcf93","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.283784Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:2706ea11b696732a0705a0ca11543563e80e5a60d5a7c34d4fb014f331667796","observation_id":"26adfdfb-51e0-40ad-97db-ff2df1d042ab","resolution":{"observed_at":"2026-08-07T13:55:59.161666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.802766Z","title":null,"venue":null,"work_id":"16d48caf-4f11-4250-b860-38707c21dfdb","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.381757Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:d98a55234b421ce2cf1ce59de1b066bd68b9b9db24f32d982525f6a5b3608935","observation_id":"42880f05-e596-424c-9dd5-7c7c1c519283","resolution":{"observed_at":"2026-08-07T13:55:58.888017Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.356404Z","title":"From these calculations, we see that the greatest possible value is indeed achieved whena=−2andb= 3, giving us: −35 9","venue":null,"work_id":"6cba0be3-a0b8-46a5-b14d-3247955f223a","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.546525Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:114483f80f7d7d4ec7a4659e9b4fe8e86cf4fc49ae7b73070847f88af184f179","observation_id":"8c2c594f-2fde-4bcc-9a59-d248968b7d93","resolution":{"observed_at":"2026-08-07T13:55:58.506243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:58.146584Z","title":"a+c= 1−1 = 03","venue":null,"work_id":"917cac7b-efa8-41ef-b427-6022bc106eda","year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.653874Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:008ef911091a4de6f27a825fca44ff5b338587ea6811f8559e2d07ac76fa1881","observation_id":"f814d688-6ba3-4f94-b94b-90668a4e6144","resolution":{"observed_at":"2026-08-07T13:55:58.263134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:55:57.924696Z","title":"X y exp(⟨θT+1 , ϕ(x, y)⟩)P y′ exp(⟨θT+1 , ϕ(x, y′)⟩) − exp(⟨θ⋆, ϕ(x, y)⟩)P y′ exp(⟨θ⋆, ϕ(x, y′)⟩) # ≤Ex","venue":null,"work_id":"af09fad4-c0cf-4df0-8448-64d2e90bbd8a","year":2020},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:57.728078Z"},"links":{"citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:090d8e6738fd1a923e0cbfc39b14fba0125652d99ef4854446de33098a280cd7","observation_id":"5ea03061-2779-4809-8854-e3be1289dffc","resolution":{"observed_at":"2026-08-07T13:55:58.018712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-10T19:31:41.185985Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-07T13:55:56.838631Z","title":"Rosie Zhao, Alexandru Meterez, Sham Kakade, Cengiz Pehlevan, Samy Jelassi, and Eran Malach","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.838631Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:21540aaf62827ad27d1b56042c0cb74caaa2880df473e28f0517ae5f65dbeef8","observation_id":"a25873b9-4bbb-48a7-b9d8-600f23a38b99","resolution":{"observed_at":"2026-08-07T13:55:56.838631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:55:56.722789Z","title":"Vikranth Dwaracherla, Seyed Mohammad Asghari, Botao Hao, and Benjamin Van Roy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:55:56.722789Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.20686"},"observation_digest":"sha256:ffa64589e4f47f8c4f1fdf86a1e5d8cd49cc7ba4439e1eff1fbae972ce422ede","observation_id":"7031781b-ba7e-4080-88d5-327e559e5f6e","resolution":{"observed_at":"2026-08-07T13:55:56.722789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20686","last_updated":"2025-05-27T03:58:50Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T17:00:52.421557Z","submitted_at":"2025-05-27T03:58:50Z","title":"Accelerating RL for LLM Reasoning with Optimal Advantage Regression"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 3 inbound Pith citation observations for arXiv:2505.20686."}