{"as_of":"2026-08-18T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b0c10721a7c0cc5a5ba95b9ea53815bfee2c4dfa3eade75638d7bfbf05c4340","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:32:13.146209Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09805/citation-record","integrity":"/paper/2608.09805/integrity","json":"/paper/2608.09805/citation-record.json","paper":"/paper/2608.09805"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2109.00157","last_updated":"2021-09-02T10:46:36Z","snapshot_observed_at":"2026-08-16T17:59:37.786854Z","submitted_at":"2021-09-01T02:36:14Z","title":"A Survey of Exploration Methods in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00157","snapshot_observed_at":"2026-08-11T10:32:12.730067Z","title":"A survey of exploration methods in reinforcement learning.CoRR, abs/2109.00157, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.730067Z"},"links":{"cited_paper":"/paper/2109.00157","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:90cd4b490fcfa4cac1a68e3fd85c2feb05892ba0e1ddbff204adfd654efa3ea0","observation_id":"463ddaed-3d44-4da6-9ce5-80f49d67d6bd","resolution":{"observed_at":"2026-08-11T10:32:12.730067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.735104Z","title":"Polaris: A post-training recipe for scaling reinforcement learning on advanced reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.735104Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:660179c589ec84ee104612ad8ddce544653d3a2cf29684f061db998a539430f6","observation_id":"37c920ea-313f-4c46-8e5e-e92705d6dc25","resolution":{"observed_at":"2026-08-11T10:32:12.735104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2602.02555","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.050484Z","title":"Learning to explore with parameter-space noise: A deep dive into parameter-space noise for reinforcement learning with verifiable rewards.CoRR, abs/2602.02555, 2026","venue":null,"work_id":"9f33bb5b-9c92-416e-a392-eca888ec0ecb","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.739164Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:d272dcc417af6a2c1618d326453bfeebcb966e1ec891d3bd601bf2e922257d59","observation_id":"9f15f11d-376d-433e-a2d4-c7a09b942c1f","resolution":{"observed_at":"2026-08-11T10:32:14.059743Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.743020Z","title":"Llama-nemotron: Efficient reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.743020Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:1d25c873d94d2fdae6fa48eb8d1bd96633aa0109a7be3a347f79b4d80c295653","observation_id":"ba81f022-c73f-4977-a899-1156cd2224c0","resolution":{"observed_at":"2026-08-11T10:32:12.743020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.747358Z","title":"Weight un- certainty in neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.747358Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:bd17ae2973aa21aa5e22ebae539c1778cb6c05201bcc376d6834a60bcf34a224","observation_id":"ae42e433-66d1-4662-a69d-e26076b8156a","resolution":{"observed_at":"2026-08-11T10:32:12.747358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00535","last_updated":"2025-05-12T10:24:14Z","snapshot_observed_at":"2026-08-15T12:44:44.609531Z","submitted_at":"2024-11-30T16:58:42Z","title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00535","snapshot_observed_at":"2026-08-11T10:32:12.751253Z","title":"Fullstack bench: Evaluating llms as full stack coders, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.751253Z"},"links":{"cited_paper":"/paper/2412.00535","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6d5ad4ad78ae22b9ccac93e5926c7ed32ff88b8d18f09bcd3ba3b84464679ec5","observation_id":"646564d1-5bb4-46a7-ac84-198d06b87cc4","resolution":{"observed_at":"2026-08-11T10:32:12.751253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.110834Z","title":"Skyrl-v0: Train real-world long-horizon agents via reinforcement learning, 2025","venue":null,"work_id":"3e132bd8-8234-4eba-930a-7b9741fabfbb","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.755926Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6171a2365805b3382eda94c3006879addafd063528f1125e413ec96673007dc4","observation_id":"06241385-ab5d-4963-b8db-254df635a039","resolution":{"observed_at":"2026-08-11T10:32:15.114998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-11T10:32:12.759973Z","title":"Evaluating large language models trained on code.CoRR, abs/2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.759973Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:da0e085f70233933f95fd5d67a426621b011ff2b023b6d996ea936fc35238540","observation_id":"21a74956-aa23-430f-82c6-254cdabc43f2","resolution":{"observed_at":"2026-08-11T10:32:12.759973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.098730Z","title":"Exploration vs exploitation: Rethinking RLVR through clipping, entropy, and spurious reward","venue":null,"work_id":"cc0b88d1-03d6-4ec4-a40e-08bfa1e09b8e","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.763941Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:40edaed6b1fc8bcf33ae2bb7817d11041b91eb83ec4217b978885098d90bc6a4","observation_id":"51591005-14da-446a-84f1-1dfa858b03f0","resolution":{"observed_at":"2026-08-11T10:32:15.102504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14280","last_updated":"2025-06-17T07:49:43Z","snapshot_observed_at":"2026-08-16T13:58:40.919947Z","submitted_at":"2025-06-17T07:49:43Z","title":"Improving LoRA with Variational Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14280","snapshot_observed_at":"2026-08-11T10:32:12.768570Z","title":"Improving lora with variational learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.768570Z"},"links":{"cited_paper":"/paper/2506.14280","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:a5496745f0deced26b316f1185266527a8f0f4c0bfc1c2fb201535ba3025e9d8","observation_id":"07287b1d-f253-4169-b518-6e5282df3d20","resolution":{"observed_at":"2026-08-11T10:32:12.768570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-11T10:32:12.774265Z","title":"The entropy mechanism of reinforcement learning for reasoning language models.CoRR, abs/2505.22617, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.774265Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6985ac3d74a08ab80763a1959df6c8ee1fb08e6fa481426e5e343014767e6dd9","observation_id":"107d603d-cb86-4f0c-8ce4-f20e8e33bb98","resolution":{"observed_at":"2026-08-11T10:32:12.774265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.086419Z","title":"Uncertainty-aware decoding with minimum bayes risk","venue":null,"work_id":"22a6b94c-2bf1-4f53-a143-f1c86804d73a","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.778746Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:c50cf33f27da2ea6ed3d38bd6f1eae863fc52b7b821282cd43ea800f90a1723a","observation_id":"b13e8654-d971-43e9-9564-14865009e741","resolution":{"observed_at":"2026-08-11T10:32:15.090956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T10:32:12.783229Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.783229Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:efc7ace480fe7287d5d8cb2bb4ec3c2230122bf5f61e47f2a42461c1176321dc","observation_id":"8c5f775f-51d5-463a-9099-8ed57d78607f","resolution":{"observed_at":"2026-08-11T10:32:12.783229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1561/2300000021","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.949353Z","title":"A survey on policy search for robotics.Found","venue":null,"work_id":"9c211122-1c42-4d35-9b6c-4e9ec50aba78","year":2013},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.786642Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:1c78f1755498190bf9c456294598b51e3f2770590f5183abe4b38a27fb06c755","observation_id":"123cc001-309e-4151-aecf-ccfc5a20a76b","resolution":{"observed_at":"2026-08-11T10:32:13.954304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.071456Z","title":"Sharpness-aware min- imization for efficiently improving generalization","venue":null,"work_id":"3df78996-1abf-4ab9-9ccc-1b2b24d8237d","year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.791126Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:447d778a1b6a4e895a8626c4a76c023d03d8ea00835eb7d6601d8c53e41d4725","observation_id":"66d0116e-5f2b-4b80-975a-7f0c8792c0b5","resolution":{"observed_at":"2026-08-11T10:32:15.076200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.059561Z","title":"Noisy networks for exploration","venue":null,"work_id":"0b28bf05-9809-4218-a448-6397795d8de8","year":2018},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.795514Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:f862b9007a9eb670cd9c18a1681756b1f86a1d3c426ad422e1f11de2f1d22919","observation_id":"0d56f047-1a95-4fb1-a99c-57e9f2decc1e","resolution":{"observed_at":"2026-08-11T10:32:15.063344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.12228","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.934219Z","title":"Neural thickets: Diverse task experts are dense around pretrained weights.CoRR, abs/2603.12228, 2026","venue":null,"work_id":"cabe3c76-4534-4ddb-b227-106d79f56d93","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.805368Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:71e0d662455b8d1a1d2cc79a5d11550bd73559ce405d485c440041eec04cff72","observation_id":"e18a1ea0-85d6-48b1-b172-5c81df055be6","resolution":{"observed_at":"2026-08-11T10:32:13.938318Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.035074Z","title":"Practical variational inference for neural networks","venue":null,"work_id":"cd035e57-8c25-4618-8823-47f9cce0e04c","year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.810372Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:3ffe60f7322f2aa5aa50bf9ddb5028f6b7a332d68d2e810c92020127a7f970a9","observation_id":"cc62d422-b240-4614-a421-cd1809e4a508","resolution":{"observed_at":"2026-08-11T10:32:15.039427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-15T23:24:42.542733Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-11T10:32:12.818963Z","title":"Skywork open reasoner 1 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.818963Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:190c45509a4fff2e06564ba21f14fbc5ddc2bf2851d0906a3100301d5db9b9d0","observation_id":"be16919a-7051-4fa5-b122-e5686d58ba26","resolution":{"observed_at":"2026-08-11T10:32:12.818963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.823287Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.823287Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:d36f34f96337ad992a2650c07e7e381a65c34c53bd381576c896f72346a8847a","observation_id":"39dcb276-4953-4707-9f8b-bd6e0c39851a","resolution":{"observed_at":"2026-08-11T10:32:12.823287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.827658Z","title":"The curious case of neural text degeneration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.827658Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:018bd770555ac85c7ec9087d8021d7f1a9209c5c235016bc6d721d99a52a906d","observation_id":"bbcfc14a-08ab-4b2f-8bbf-1ae24b45ff93","resolution":{"observed_at":"2026-08-11T10:32:12.827658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2510.01180","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.822122Z","title":"Brorl: Scaling reinforcement learning via broadened exploration.CoRR, abs/2510.01180, 2025","venue":null,"work_id":"c7092f75-d1f9-4295-8cfc-b30a40290e60","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.832290Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:99d1b38548db7f7787a35621d30b17d25623b9c5b34ea9a9e49f13cfc5f7d0fd","observation_id":"aa45cfff-3eec-4ef9-b7ea-ce9b847dbacf","resolution":{"observed_at":"2026-08-11T10:32:13.827218Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.987141Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"f5b22961-c7a0-4b85-b534-677f25faf0d1","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.837036Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:56dfcaff89b08f2519f09e257c06c2e08892db12a142a0f56af087abe28d1fc2","observation_id":"45a2747d-aeee-4978-8f5f-d1e3705c635c","resolution":{"observed_at":"2026-08-11T10:32:14.991288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.842280Z","title":"Near-optimal regret bounds for reinforcement learning.J","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.842280Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:b1b7efe16597d984608a39fd5891565cc203a65924e265338c765bb45beead4f","observation_id":"b29344e8-1bd0-4d1f-81af-47409f0aa669","resolution":{"observed_at":"2026-08-11T10:32:12.842280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.25133","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.750570Z","title":"Rethinking entropy regularization in large reasoning models.CoRR, abs/2509.25133, 2025","venue":null,"work_id":"3ac08db9-95c8-4a9e-a551-7d065c338596","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.846240Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6d33ae431fcf3325e23fa025a751fbfb2f0c2ffa204f112f51cf657bcfe659ce","observation_id":"b589645f-91ae-44e4-a097-1f32185282a3","resolution":{"observed_at":"2026-08-11T10:32:13.757133Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.975846Z","title":"The bayesian learning rule.Journal of Machine Learning Research, 24(281):1–46, 2023","venue":null,"work_id":"eae46bdd-1b6e-4cbd-9ba5-e226a04a4672","year":2023},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.850986Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:48aff40d7ed7b3a11a87d8bc2d06a6000136b4cfce649d52692992aea8196028","observation_id":"4fa8d917-90a4-44d0-8db7-8b6913d2551e","resolution":{"observed_at":"2026-08-11T10:32:14.979814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.962319Z","title":"Fast and scalable bayesian deep learning by weight-perturbation in adam","venue":null,"work_id":"ecd7d33e-5d6e-43af-91e5-e9c99393cfa0","year":2018},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.854665Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:5aa7b08dd7dae4ec4e4e133b424190140ecee859e6e4701bef2203386022fecd","observation_id":"f3337831-493b-48d4-8920-4c952f4b3dd9","resolution":{"observed_at":"2026-08-11T10:32:14.967885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.949804Z","title":"Generalized variational inference: Three arguments for deriving new posteriors","venue":null,"work_id":"b1d7c0c5-c54a-4ec2-9a11-270a6dab8712","year":2019},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.858567Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:e47c1f5bdffefac9f5f3096746d7b127150a91b1781ea4b5bc2ba7692f25ab9b","observation_id":"7af71b16-0a03-4670-a9b4-38097d635421","resolution":{"observed_at":"2026-08-11T10:32:14.953142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.13074","last_updated":"2020-11-23T20:12:39Z","snapshot_observed_at":"2026-08-14T11:08:44.696707Z","submitted_at":"2020-04-27T18:11:12Z","title":"The Case for Learning Application Behavior to Improve Hardware Energy Efficiency","version":2},"cited_work":{"arxiv_id":"2004.13074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.13074","snapshot_observed_at":"2026-08-11T10:32:14.351109Z","title":"The Case for Learning Application Behavior to Improve Hardware Energy Efficiency","venue":"cs.AR","work_id":"61f08f27-ae2e-40fa-9d7a-a269c99aff07","year":2020},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.863076Z"},"links":{"cited_paper":"/paper/2004.13074","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:11d1fdb6365df5745cd7f096abec3ff9da958161e1a4fb6c96e69987f2ad7850","observation_id":"e15d98a9-9f10-44d7-9cb6-9be57a09ff38","resolution":{"observed_at":"2026-08-11T10:32:14.357333Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.868294Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.868294Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:898740bdb194e30e4a072faf49749d37a967b542cea7db608f8930a194f7f4f6","observation_id":"e0fefb07-c04c-48d0-aa5b-12d3b47a11b5","resolution":{"observed_at":"2026-08-11T10:32:12.868294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-17T14:11:00.232598Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T10:32:12.885592Z","title":"Miranda, Alisa Liu, Nouha Dziri, Shane Lyu et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.885592Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:a732b43c4ca487aae54638f2d1bed055179dbea7a4984b5ba43b69f2986b545d","observation_id":"4f434f82-1798-4f91-af72-e455398bb5bd","resolution":{"observed_at":"2026-08-11T10:32:12.885592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.937969Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo et al","venue":null,"work_id":"d9107791-56e1-4eae-94dd-16b92932de11","year":2022},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.890555Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:a9049d6fecfa49ff8c1f662276e3fc5284402f3506b84634acd4d6b05685e6dd","observation_id":"32432725-071a-4e0f-afec-715aa718c91a","resolution":{"observed_at":"2026-08-11T10:32:14.941961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.924588Z","title":"Verified taco problems","venue":null,"work_id":"3b82ae6c-8184-43c2-8f3e-03c76569f187","year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.896238Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:e18ef6a49d970f5990891edabdaceddd21c695552c60dc99e72e84802d737966","observation_id":"0563aac8-04f5-4dc0-80f6-170c4957c00d","resolution":{"observed_at":"2026-08-11T10:32:14.929410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.912701Z","title":"Handling the positive-definite con- straint in the bayesian learning rule","venue":null,"work_id":"e28a51d4-0de9-4a2f-8815-6ea43d2cec43","year":2020},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.901478Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:d1b55ea1851398f72d1cdaeba00f2cda6c301ab5e4edbd232a828fe7d83d8c92","observation_id":"09e3f26f-11c0-46cb-8543-b0b7b43bf160","resolution":{"observed_at":"2026-08-11T10:32:14.916744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.898464Z","title":"When speed kills stability: Demystifying RL collapse from the training-inference mismatch","venue":null,"work_id":"7d81f592-3b84-41c4-8376-6a209d1ac151","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.907014Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:2ce39bf36664749a647f5cc203eff143643a28a75719b16a567d28af8d55b5b8","observation_id":"bdc9df48-1918-4067-baef-34908d197424","resolution":{"observed_at":"2026-08-11T10:32:14.903579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.911912Z","title":"Code-r1: Reproducing r1 for code with reliable rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.911912Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:85689b5e78b46808ed2f4925212e8bc9afd01659344eaec99e88438cdc2e7545","observation_id":"48cddb81-4e20-40a9-b123-3e65c7504c61","resolution":{"observed_at":"2026-08-11T10:32:12.911912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-11T10:32:12.916702Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.CoRR, abs/2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.916702Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:2b144ed94054b000ef1532b8159436bede8871f058ce88fc9bcc167b011d546c","observation_id":"469e5597-9969-4364-bdd8-aefef327d7dd","resolution":{"observed_at":"2026-08-11T10:32:12.916702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.876949Z","title":"Regularization matters in policy optimization - an empirical study on continuous control","venue":null,"work_id":"5ec49ab0-0540-4241-b102-bcaed27f1a00","year":2021},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.920919Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:e1699fa4336dfc629c4009800a78bc2a34b779e7722ad668de3c9c045642aa0f","observation_id":"c46c7011-3bd6-4da4-b5ac-95641628bd36","resolution":{"observed_at":"2026-08-11T10:32:14.881665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.929977Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.929977Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:1b5b1b3cba446b1a44a3e5b313068e075e1f85043380803c4fda5028c504778f","observation_id":"7d98b97b-749e-4c50-9625-8c85bb0645d3","resolution":{"observed_at":"2026-08-11T10:32:12.929977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.935853Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.935853Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:89475a8c969a42c9f7d75d49549c620cdcd9801da8ae91811fe7ae0257da9eb9","observation_id":"d1efa133-d7be-4794-bd75-3f0a4a52fb6a","resolution":{"observed_at":"2026-08-11T10:32:12.935853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.830252Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa et al","venue":null,"work_id":"d3aabceb-c32e-4ff9-8bbb-803fc24f0d47","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.940625Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:cc2be9fd7d27fb5f1f30d786531e60b6d9da60074cf672f4cdd0519cd04179f1","observation_id":"7e5db798-f81c-4539-9cb9-43dfa506115c","resolution":{"observed_at":"2026-08-11T10:32:14.834331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.945458Z","title":"American Invitational Mathematics Examination, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.945458Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:d6889f1b6025485a32df6e7dc91cc2949ebf8fbeecd1af0303dbc134992b92e1","observation_id":"8eba8178-36aa-4337-9dff-9572eaa26618","resolution":{"observed_at":"2026-08-11T10:32:12.945458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23357","last_updated":"2026-07-09T05:20:17Z","snapshot_observed_at":"2026-08-08T21:08:12.419631Z","submitted_at":"2026-06-22T13:56:59Z","title":"SOAP-Bubbles: Structured Weight Uncertainty for Neural Networks","version":2},"cited_work":{"arxiv_id":"2606.23357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23357","snapshot_observed_at":"2026-08-11T10:32:14.266606Z","title":"SOAP-Bubbles: Structured Weight Uncertainty for Neural Networks","venue":"cs.LG","work_id":"42eab20c-7007-492d-a77a-6d5979adeff8","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.952545Z"},"links":{"cited_paper":"/paper/2606.23357","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:fee6e511268967a148fcc652003a619de8e30f904ef52e32acfa3517f2d6fd6b","observation_id":"fb3d2388-c503-41d7-8992-9b9b8033965a","resolution":{"observed_at":"2026-08-11T10:32:14.270721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.808450Z","title":"SAM as an optimal relaxation of bayes","venue":null,"work_id":"8641277e-e243-4df0-baae-7241f93c9a79","year":2023},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.957266Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:10b7b4ca3169c5dede7749f0bd57e8d9833065d661152ecae9390d256f1e5836","observation_id":"fdfe7acf-c09e-43e7-9b63-70e8b6eabbc9","resolution":{"observed_at":"2026-08-11T10:32:14.812635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.796028Z","title":"Faster, more efficient RLHF through off-policy asynchronous learning","venue":null,"work_id":"814f92ee-22d6-489f-bc1b-9f238e23ce8f","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.961285Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:4a91c884c4e19ae0ce56dbb722a6424ecb9bd15a2ba1a4e8108231170c5e31d3","observation_id":"e36fba69-5a95-4a91-ac65-ca1b408713c6","resolution":{"observed_at":"2026-08-11T10:32:14.800601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-11T10:32:12.966627Z","title":"Olmo 3, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.966627Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:111520f44bdc3915b410e0ca5f95639fd527dba12915e2bc37e4d1c05dedd196","observation_id":"31f11779-fdc0-4d42-8776-bacf1706d5bc","resolution":{"observed_at":"2026-08-11T10:32:12.966627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.783141Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray et al","venue":null,"work_id":"26be7b66-1043-4354-be6d-0c25e709f993","year":2022},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.973226Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:9b797c9a70e3fe14c9d039380a30b6893f325d5c2a2fc402bc293a0a5d51c4ec","observation_id":"73ad86e3-942c-475a-800f-ef103c20bef4","resolution":{"observed_at":"2026-08-11T10:32:14.787028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.772330Z","title":"Chen, Xi Chen, Tamim Asfour, Pieter Abbeel, and Marcin Andrychowicz","venue":null,"work_id":"6059bf16-ecef-4b35-8462-dce1bf7ab8b6","year":2018},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.978337Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:faa2a616ac0941fa9f9975de86c09579d79cfabcf707ff23da6ed3ceff4dd8d7","observation_id":"cef92906-a67a-47bc-82b4-1a8377b882dc","resolution":{"observed_at":"2026-08-11T10:32:14.776599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.759828Z","title":"Exploring parameter space in reinforcement learning.Paladyn J","venue":null,"work_id":"c84fe196-1f67-4ae6-84a5-48974333515b","year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.983370Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:0ec3be55010e550e3545153827190b0e6e4a14500a2f22dfe83882478d4d89ad","observation_id":"f75a85d1-56bd-4d9c-9930-7d709691dc09","resolution":{"observed_at":"2026-08-11T10:32:14.763936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.03864","last_updated":"2017-09-07T23:28:48Z","snapshot_observed_at":"2026-08-14T21:12:24.197125Z","submitted_at":"2017-03-10T23:02:19Z","title":"Evolution Strategies as a Scalable Alternative to Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.03864","snapshot_observed_at":"2026-08-11T10:32:13.001257Z","title":"Evolution strategies as a scalable alternative to reinforcement learning.CoRR, abs/1703.03864, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.001257Z"},"links":{"cited_paper":"/paper/1703.03864","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:ba134141a0755c66bcdb09e378c442c6f872201798686b45051413d658e02772","observation_id":"cc300bdb-8913-4a54-b274-81d3787e8a95","resolution":{"observed_at":"2026-08-11T10:32:13.001257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.006112Z","title":"Parameter-exploring policy gradients.Neural Networks, 23(4):551–559, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.006112Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6ad7c2403e9248c39ae36bd7733662d31645c6a28ccbe6971290961ae15b7e43","observation_id":"2c1d7bd0-2199-4cbf-b47a-887012c3dd81","resolution":{"observed_at":"2026-08-11T10:32:13.006112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-18T17:39:46.587540Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-11T10:32:13.013301Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.013301Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:e57eb75a20a6317642a36f97d12c4ecaeb33fb22f60fbec8906e6f67658d5873","observation_id":"a38eab6a-6954-4594-88ba-7018c0acc17e","resolution":{"observed_at":"2026-08-11T10:32:13.013301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T10:32:13.019444Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.019444Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:74dd5578a004a11248b961aa611c45570414c67d5ec458efbad49d4daf845308","observation_id":"3c22fee3-d2a8-4aba-a5a5-480d4c63475d","resolution":{"observed_at":"2026-08-11T10:32:13.019444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.024389Z","title":"On entropy control in LLM-RL algorithms.CoRR, abs/2509.03493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.024389Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:710813b8edd10d0c29c15272d211da1b13a68f0d0169f99ccfaffa18143f4c86","observation_id":"cdc4d653-dc12-4ea8-b959-48296873be97","resolution":{"observed_at":"2026-08-11T10:32:13.024389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.748218Z","title":"Variational learning is effective for large deep networks","venue":null,"work_id":"e825d60c-fa57-424e-926f-4d59cb2c81b4","year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.030530Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6264b51c5b2367d99a410cd4715587a852cae3ab07f76ec9d02068f2fc57207c","observation_id":"fc207249-b380-469b-8164-1bfd76a837c6","resolution":{"observed_at":"2026-08-11T10:32:14.752260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-11T10:32:13.039985Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.039985Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:3470c2553802400b9e1103c6affc3aa478e7fd9f83556c0344399b7f1d94c76d","observation_id":"5c5e5b2e-d02f-4f6e-a25a-efb5754ff767","resolution":{"observed_at":"2026-08-11T10:32:13.039985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.044273Z","title":"Strehl and Michael L","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.044273Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:daddb2585d78f8f8a1a920c6828a5f49b13d1a1e8395328cc474573096a56115","observation_id":"01429360-ac01-4efa-876a-3e51d1e403cb","resolution":{"observed_at":"2026-08-11T10:32:13.044273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.723645Z","title":"Path integral policy improvement with covariance matrix adaptation","venue":null,"work_id":"6e3027d5-447b-4ae7-b0c6-c2899fbac947","year":2012},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.048926Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:1832a7e64dd6c80387405aab472eea353289ff40a2fbc1c70bcf2175ce1d6db1","observation_id":"0ed17521-795b-4680-9582-a16643fe2b55","resolution":{"observed_at":"2026-08-11T10:32:14.727527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.710737Z","title":"RL grokking recipe: How does RL unlock and transfer new algorithms in LLMs? InThe Fourteenth International Conference on Learning Representations, 2026","venue":null,"work_id":"38bcece8-8a49-4b9a-89c8-6a7f4a7e8774","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.053355Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:656f6b7769d8898643a4831a2e9c70e7ccf91c4348ecee5dd8df3a6b60a2944a","observation_id":"2603b6f4-9c35-4596-81a3-4981b964bb16","resolution":{"observed_at":"2026-08-11T10:32:14.714895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.699548Z","title":null,"venue":null,"work_id":"d614faaa-84be-420d-a9f1-a586852930d6","year":1995},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.059829Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:833516752f2452446953d5a7dbcb5ed5f2ed3ee9c5994c0d9896d7edc00d6498","observation_id":"2f6d0311-0935-4286-a635-9965396094f6","resolution":{"observed_at":"2026-08-11T10:32:14.703322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.687856Z","title":"Sutton and Andrew G","venue":null,"work_id":"7e12f302-ed9d-40ff-8ab5-6821e9b8fdb3","year":1998},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.066364Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:496e7b6005e47fa54d637b1455d4b712cd6ce57bea6c4021d987940c2cd0c252","observation_id":"ae7c3df1-a809-46b8-bf67-5dce78e32c75","resolution":{"observed_at":"2026-08-11T10:32:14.691421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.071427Z","title":"Theodorou, Jonas Buchli, and Stefan Schaal","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.071427Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:305d5210888991d13d9d47a655160b8c2b0bde50a125bf5c041bcfb479d972c0","observation_id":"907023fd-33b9-4a78-abcb-d1b231d7cdbc","resolution":{"observed_at":"2026-08-11T10:32:13.071427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-017-5657-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.566814Z","title":"Generalized exploration in policy search","venue":null,"work_id":"cd48cde1-1af3-4697-8ebe-8b995c4a22c2","year":2017},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.076147Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:d9e9be27806d9c3cc19c26aa3a8818d5eff0e33eea37cb418981f7bbc071ff31","observation_id":"90fa11a7-9efa-4a55-b408-9ac2e528f2aa","resolution":{"observed_at":"2026-08-11T10:32:13.571135Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.12186","last_updated":"2026-08-17T15:16:28Z","snapshot_observed_at":"2026-08-18T17:20:36.550946Z","submitted_at":"2026-01-17T22:30:45Z","title":"Aletheia: What Makes RLVR For Code Verifiers Tick?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.12186","snapshot_observed_at":"2026-08-11T10:32:13.081086Z","title":"Aletheia: What makes RLVR for code verifiers tick?CoRR, abs/2601.12186, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.081086Z"},"links":{"cited_paper":"/paper/2601.12186","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:f8c64db8fc19d912472f171f27e86e34db831fdcb0b6285126194f5b7a82fa22","observation_id":"b3f7816e-f0b6-4c34-bb47-255a26c11571","resolution":{"observed_at":"2026-08-11T10:32:13.081086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-08-16T21:10:35.590654Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-11T10:32:13.087281Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning.CoRR, abs/2506.01939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.087281Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:141b0e2b4026b3fce878c59d9ddf905047470b19bd0819cbc27e1155c04f33c9","observation_id":"6a678b06-4ac0-45a2-bfd0-706db61a7da8","resolution":{"observed_at":"2026-08-11T10:32:13.087281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.092467Z","title":"Learning from delayed rewards","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.092467Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:88553e4e3561ff2938432b7c014dcf18a7954583716ff5b41fdcb641113246b1","observation_id":"b1068912-5ebc-47e3-80c3-77ecc4ab946b","resolution":{"observed_at":"2026-08-11T10:32:13.092467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.668370Z","title":"Adversarial weight perturbation helps robust generalization","venue":null,"work_id":"321354aa-a5a5-4677-b6a6-3610a438a90f","year":2020},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.097808Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:b7c8833876f53e6048e243a11ee057143b322a10621d13626b10ac4470f8f88e","observation_id":"87d8fd76-b25b-4726-88e9-bfa2efb01d1c","resolution":{"observed_at":"2026-08-11T10:32:14.672871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.102018Z","title":"The invisible leash: Why RLVR may not escape its origin.CoRR, abs/2507.14843, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.102018Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:138f7c19c35772e15288fcf48c846f651e11e6bec5fa88ea215dd60ba3f1777b","observation_id":"15766fb5-f584-47d9-9500-f27ae32303ae","resolution":{"observed_at":"2026-08-11T10:32:13.102018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i40.40687","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.656080Z","title":"Reasoning or memorization? unreliable results of reinforcement learning due to data contamination","venue":null,"work_id":"4a355a4d-34c5-4f8d-b00e-f57fd0bf0dd6","year":2026},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.108060Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:189f82e81b89afc9a9fd8db61ad2d57f01702a9ee14a6b381fa72fdfe234c138","observation_id":"a2c6d4d7-5060-4d36-af4c-9dcc5e70c0d1","resolution":{"observed_at":"2026-08-11T10:32:14.660615Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-17T18:51:13.219936Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-11T10:32:13.111958Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.111958Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:5976adcabeb4593c2f65171c66595b327751a4ce1f68b186334152f2f30b5e50","observation_id":"51e4aa03-2498-412f-89c4-f1a4775f3258","resolution":{"observed_at":"2026-08-11T10:32:13.111958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.116229Z","title":"Your efficient rl framework secretly brings you off-policy rl training, August 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.116229Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:2dba8fc1c0fd69efd2a898298c5492705411e50758c5c5b023903ff5692ce901","observation_id":"c678ef5a-4c70-40ef-8213-ed6ce0076ec3","resolution":{"observed_at":"2026-08-11T10:32:13.116229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2510.04028","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.443755Z","title":"The debate on RLVR reasoning capability boundary: Shrinkage, expansion, or both? A two-stage dynamic view.CoRR, abs/2510.04028, 2025","venue":null,"work_id":"27289309-3a3e-47a7-8091-d5e482e48891","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.120490Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:ff42b4d6097ac25a618ee554dbc6edfc5e1f863384284bd822f234bb8cbdb399","observation_id":"19cd3682-c4e9-46fa-8e09-ac3dbf307f84","resolution":{"observed_at":"2026-08-11T10:32:13.447823Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.633351Z","title":"DAPO: An open-source LLM reinforcement learning system at scale","venue":null,"work_id":"b615616f-3f67-41e5-9bce-230088485f3e","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.124865Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:55983ddacd114d7644a76b8c1b6f40b49883a0f78105ed110825fad9c051f67c","observation_id":"7fc9da07-b433-44a7-943c-b608181a1e43","resolution":{"observed_at":"2026-08-11T10:32:14.638208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-17T19:03:31.231829Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-11T10:32:13.129972Z","title":"Kakade, Cengiz Pehlevan, Samy Jelassi, and Eran Malach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.129972Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:7b1305924aa54b0bd14adb270b4a8926d866d5b534f0d095bd758e10fd9a9d89","observation_id":"91df57ff-200d-4d8b-b1c3-ad18867ce443","resolution":{"observed_at":"2026-08-11T10:32:13.129972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-11T10:32:13.137555Z","title":"Group sequence policy optimization, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.137555Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:27b7a7d13ca97954c9ee7637eb617d5a6c30ad0310fc14abf23dcf6a414ddfb8","observation_id":"93db9b12-6f5e-4340-865a-1dbfa34e2bfa","resolution":{"observed_at":"2026-08-11T10:32:13.137555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.617934Z","title":"The surprising effectiveness of negative reinforcement in LLM reasoning","venue":null,"work_id":"36d2c0df-577d-412b-86cd-124fd31e500a","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.142111Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:e87e2593dd8adbefca3f05a699e16528be6356d1f20ddb294f9121fb9e5385c9","observation_id":"7d653e8f-31f8-4780-9f55-d034ef0ebb78","resolution":{"observed_at":"2026-08-11T10:32:14.622844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2510.08892","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:13.349549Z","title":"Exploring multi-temperature strategies for token- and rollout-level control in RLVR","venue":null,"work_id":"8c214559-7ac0-4df4-bf78-5be631fb5b4b","year":2025},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.146209Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:25271a4b5b04c3771d7fd765e136d57cb65fdbbb3fd7c64ca1bb3db3b2aadc1d","observation_id":"053302a1-ebd4-4250-ac2e-12f4ab659af2","resolution":{"observed_at":"2026-08-11T10:32:13.355286Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:12.988600Z","title":"URL https://doi.org/10.2478/s13230-010- 0002-4","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.988600Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:6263b6646358b5d2448f08b36321ff1fb4dc46b06ae935ddd828f7483923e2ff","observation_id":"0cbc3438-9d41-410a-8c07-9614d43308a1","resolution":{"observed_at":"2026-08-11T10:32:12.988600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.023304Z","title":null,"venue":null,"work_id":"a5162454-5171-4961-af40-0f63d8111eb9","year":2011},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.814815Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:b1b53b3888098126de11f72e6d865a94fc5bdab7629a97a0528cadc6e16c1cba","observation_id":"f8a980b0-da8d-4898-8282-325438106671","resolution":{"observed_at":"2026-08-11T10:32:15.027341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:15.048329Z","title":null,"venue":null,"work_id":"72033936-ad16-4068-9b2d-b5a78ec1a71b","year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.801070Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:9db0b9b768f11b74254ff6ed61865261801263665e670e911412bfc8e16b12e4","observation_id":"f282f0ce-7eb4-47dd-8d52-efd6e25bef35","resolution":{"observed_at":"2026-08-11T10:32:15.052051Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.863425Z","title":null,"venue":null,"work_id":"4993afa5-56de-43d5-8dbe-79b581927a2e","year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:12.924363Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:75283a743fe5af6a3d51c71a586d14846581a1e2cf8b7f9569e2e263e65df131","observation_id":"937248b9-6481-4813-a1fc-2729e8ad8412","resolution":{"observed_at":"2026-08-11T10:32:14.868197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T10:32:14.735901Z","title":null,"venue":null,"work_id":"7dac5352-ab5c-48e6-968c-c6350420a193","year":null},"citing_paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T10:32:13.035731Z"},"links":{"citing_paper":"/paper/2608.09805"},"observation_digest":"sha256:47cabbb6ef54ee3bae01318e6d42c55b86ef17d1ed7bfe4868d3e105fdafe097","observation_id":"a210d05b-a4f2-4727-9d7d-3edfdf420c50","resolution":{"observed_at":"2026-08-11T10:32:14.739485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09805","last_updated":"2026-08-10T16:28:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T16:13:24.972450Z","submitted_at":"2026-08-10T16:28:07Z","title":"Parameter Exploration for RLVR via Variational Learning"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":43,"verified_exact":10,"verified_fuzzy":28},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2608.09805."}