{"as_of":"2026-08-09T23:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ac05e25047e83272d67643ffd2c46dd5c9dd5bb75f541cc0dc8e3e09caf05a8e","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:03:28.188682Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T00:02:24.352947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T00:02:25.252362Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"cited_work":{"arxiv_id":"2508.07534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From trial-and-error to improvement: A systematic analysis of llm exploration mechanisms in rlvr","venue":null,"work_id":"ac56228f-c766-462e-8c76-3db7885a98e2","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2508.07534","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:4828c43bad1eef117bba60ff030e806d728369dc3e78eaa4d02e4dd591e4d0e7","observation_id":"9a761aa7-9967-4ef2-81d7-1f3f78de71b1","resolution":{"observed_at":"2026-05-18T00:02:25.255020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"cited_work":{"arxiv_id":"2508.07534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From trial-and-error to improvement: A systematic analysis of llm exploration mechanisms in rlvr","venue":null,"work_id":"ac56228f-c766-462e-8c76-3db7885a98e2","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2508.07534","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:f218f227c839aab5776a02a819c22182c32eb622b7320d475e7004d916cb6a8d","observation_id":"ffad19ef-e6cf-4214-9ca7-868e40a51bff","resolution":{"observed_at":"2026-05-11T15:41:45.790129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"cited_work":{"arxiv_id":"2508.07534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From trial-and-error to improvement: A systematic analysis of llm exploration mechanisms in rlvr","venue":null,"work_id":"ac56228f-c766-462e-8c76-3db7885a98e2","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-02T19:56:31.797001Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2508.07534","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:5a931f7325c3fdda1cd55ad191a6b8fdb47d99d0d85932441dd8763f0c441fa7","observation_id":"5c712013-bb5f-41fa-9ad7-1ab6b67256b3","resolution":{"observed_at":"2026-05-11T03:55:56.685011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07534/citation-record","integrity":"/paper/2508.07534/integrity","json":"/paper/2508.07534/citation-record.json","paper":"/paper/2508.07534"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02260","last_updated":"2025-08-04T10:08:10Z","snapshot_observed_at":"2026-08-06T05:04:32.009541Z","submitted_at":"2025-08-04T10:08:10Z","title":"Decomposing the Entropy-Performance Exchange: The Missing Keys to Unlocking Effective Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02260","snapshot_observed_at":"2026-08-05T22:03:28.053726Z","title":"Decomposing the entropy-performance exchange: The missing keys to unlocking effective reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.053726Z"},"links":{"cited_paper":"/paper/2508.02260","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:47d8f6f7114c69138ce10d7460e44c8ad83a1f0d7d22e98829cd777236340087","observation_id":"322ba5f0-cb9c-49f0-8b58-317bba6f33f2","resolution":{"observed_at":"2026-08-05T22:03:28.053726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T22:03:28.058500Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.058500Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:738c2fcf2734534aaf2aa15d39c89e166cc2c53f052df45776f1a16de7463229","observation_id":"2905d31a-65ad-473e-818e-f86ae11c2154","resolution":{"observed_at":"2026-08-05T22:03:28.058500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.063021Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.063021Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:54766fd3e1e88a4fa7dc94f4202d78edc814ef8e3dbe7a85964245b6a9711e72","observation_id":"17e3e04c-cc53-4260-ba52-1bdd66cd14ea","resolution":{"observed_at":"2026-08-05T22:03:28.063021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T22:03:28.067351Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.067351Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:7ba9a03aa7e54af51e271ed94a23bff5da8a360ddb8b3ecb8c140fd9a9d1323f","observation_id":"b421bde8-3511-4eac-92c2-d25e8ddbe07a","resolution":{"observed_at":"2026-08-05T22:03:28.067351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.758514Z","title":null,"venue":null,"work_id":"fcc2f4c8-1541-4727-a62e-fbaeea9ae775","year":2016},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.071721Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:049b2ce4d378e27cb3b42756b1512d1f28062d58ba5e9a890ade9abe119d8e9c","observation_id":"9624f8e9-1b9d-4e39-bf3b-54a9be2b8fbc","resolution":{"observed_at":"2026-08-05T22:03:28.762818Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T22:03:28.075990Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.075990Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:d4e501efcde76e289356ebd0256a29966db9d8560bfc91bafd044b19faa1d108","observation_id":"f4095a71-a846-4d77-bd8c-352760ee80b8","resolution":{"observed_at":"2026-08-05T22:03:28.075990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T22:03:28.081012Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.081012Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:ca8fe8996168669591060c728e05acc41cac4f300878169f686715e82f2d6176","observation_id":"24bdff8e-b204-4b53-a0f5-c33bd7634669","resolution":{"observed_at":"2026-08-05T22:03:28.081012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.085936Z","title":"Exploration in deep reinforcement learning: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.085936Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:af1facce0ed9792eb8187d78638fadd3e5503a74cef0c1f09ae5be898d988504","observation_id":"011fa54c-4c8a-4470-a3b9-79a31d60fabc","resolution":{"observed_at":"2026-08-05T22:03:28.085936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T22:03:28.090177Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.090177Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:7f3dca8003f693173b31e9d55762fae0df44f557eb793b56fac5d90310b21934","observation_id":"b4e661c4-d523-4537-b298-07d6ce18cea9","resolution":{"observed_at":"2026-08-05T22:03:28.090177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T22:03:28.094332Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.094332Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:9a3593d0de46856ab079b41adb91141f4d4ac262060083b843c15359fe6522d3","observation_id":"67bce6db-ecda-40bc-9b2e-5cd71a80e58a","resolution":{"observed_at":"2026-08-05T22:03:28.094332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.098747Z","title":"The surprising effectiveness of negative reinforcement in llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.098747Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:9b982d8929d6745f85b3edb0f271dacc6dd55fe68636fe56d91b298e4eaa5472","observation_id":"d6d691cb-a13d-487d-b724-d22111c95a82","resolution":{"observed_at":"2026-08-05T22:03:28.098747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.733037Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":"4bbb6656-c9a3-461a-ae10-b90e4a6c4f30","year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.103031Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:b6c92631b2835be9a21a37a7a1b0a388f66495d8e87ddee1e540135f1667c64b","observation_id":"bd046845-72d6-4737-8501-5894b9ebd3da","resolution":{"observed_at":"2026-08-05T22:03:28.737764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T22:03:28.107150Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.107150Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:7ddafe4ed74c036deee705e4de696edf2e8b65c1fc3f76e84e61f2e6c9360754","observation_id":"c2f1dcbc-69c2-4cb8-bdc3-a75f9d9db686","resolution":{"observed_at":"2026-08-05T22:03:28.107150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T22:03:28.111517Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? CoRR , abs/2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.111517Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:dead0324b36753dc14fd13447d8e785617b3ff369afea31c74687d45b8abef4d","observation_id":"50c3b81c-2c61-4c63-8326-dde21d646ebe","resolution":{"observed_at":"2026-08-05T22:03:28.111517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T22:03:28.116441Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.116441Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:5614910bd147138d4977809a962a726fc6787241f82ab99ede3ca03b5058e474","observation_id":"0b894881-4190-409d-9d68-3950e4797a83","resolution":{"observed_at":"2026-08-05T22:03:28.116441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T22:03:28.120627Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.120627Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:beb7bcd0dba437b164e6e3bd91a8ea4f715ad5dcb358a247ebca5c687f542193","observation_id":"55ca83fb-bc87-4b29-8023-c78c84d38c92","resolution":{"observed_at":"2026-08-05T22:03:28.120627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-08-05T22:03:28.124820Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.124820Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:f670ea598b20ad03392eb64af5f297fc3faee5c549b34318b7a139022c838b37","observation_id":"c40f1373-96d7-47d6-bf88-a85fa7fb7c7d","resolution":{"observed_at":"2026-08-05T22:03:28.124820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.718590Z","title":null,"venue":null,"work_id":"2f03a28b-a699-413a-bd4f-7e7a570c1089","year":1948},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.128868Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:be79914882f6e4bc87988bfd14fc444b286fa9bd67fef4b82e6352ead2e5ae5a","observation_id":"55958e60-b658-4583-af0f-e5401c34048b","resolution":{"observed_at":"2026-08-05T22:03:28.722600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.704846Z","title":"Let's verify step by step","venue":null,"work_id":"47038f0c-68b3-417b-80fa-d35d78db70dd","year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.132945Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:27a32fa02459a9aa16d9a2a5ecdb6cc6fbd21a44a9241b7f94b318513289f9a7","observation_id":"a748fea4-02d5-468e-bc1d-8767a55ab860","resolution":{"observed_at":"2026-08-05T22:03:28.709392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.689299Z","title":"Generative verifiers: Reward modeling as next-token prediction","venue":null,"work_id":"3d8659a9-34d6-4428-b0ca-0de76e942c49","year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.136547Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:f446eb791cc54a8e8cebb5f48e07b3ee2f0dc6e7f17e2985921eea6d15088a0e","observation_id":"54180ce1-e458-43c7-9ce9-475e1ca386df","resolution":{"observed_at":"2026-08-05T22:03:28.693699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.675087Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":"b8ea9847-4ac8-446e-8c17-4d7681d788f0","year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.140300Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:3689aa63e49878b89bdd9a0cf0c880e26bec4ae54458ee6ad594a3836f112fd1","observation_id":"162588cb-f6b0-4e4e-8c70-8508c9f4bc9b","resolution":{"observed_at":"2026-08-05T22:03:28.679544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11694","last_updated":"2024-12-31T01:38:12Z","snapshot_observed_at":"2026-08-09T03:55:09.041328Z","submitted_at":"2024-11-18T16:15:17Z","title":"Enhancing LLM Reasoning with Reward-guided Tree Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11694","snapshot_observed_at":"2026-08-05T22:03:28.144048Z","title":"Technical report: Enhancing LLM reasoning with reward-guided tree search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.144048Z"},"links":{"cited_paper":"/paper/2411.11694","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:ec6c002157268b042c945dcd4d6df8259fdaaad4b9e70c6762972e987c7b9cc0","observation_id":"ea005420-8fac-45fb-be45-2bb5acf2547f","resolution":{"observed_at":"2026-08-05T22:03:28.144048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.147876Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.147876Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:eca34c3d1d593345a3f8b4c8ef2274ba2d34fe95dd237cc622c80625e70612ef","observation_id":"e7e5d277-296f-40f4-95ee-93a817267c03","resolution":{"observed_at":"2026-08-05T22:03:28.147876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10337","last_updated":"2025-04-16T14:58:26Z","snapshot_observed_at":"2026-08-07T16:05:50.114818Z","submitted_at":"2025-04-14T15:46:33Z","title":"Heimdall: test-time scaling on the generative verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10337","snapshot_observed_at":"2026-08-05T22:03:28.151638Z","title":"Heimdall: test-time scaling on the generative verification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.151638Z"},"links":{"cited_paper":"/paper/2504.10337","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:1fd1681c4d8e133b81ec4b5db439a9b3d276a36908ce78dd9d13c3838c9955bc","observation_id":"f5b52097-3d64-4337-b9f5-4207d2bca587","resolution":{"observed_at":"2026-08-05T22:03:28.151638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24480","last_updated":"2025-05-30T11:30:18Z","snapshot_observed_at":"2026-08-09T17:09:03.936400Z","submitted_at":"2025-05-30T11:30:18Z","title":"Towards Effective Code-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24480","snapshot_observed_at":"2026-08-05T22:03:28.155704Z","title":"Towards effective code-integrated reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.155704Z"},"links":{"cited_paper":"/paper/2505.24480","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:8e58a641cb8bbf8fec228a8f6074ae15db3333aaac498b8281228f282c7f65f9","observation_id":"a5d8a914-54b5-435e-9846-bef7c95d6450","resolution":{"observed_at":"2026-08-05T22:03:28.155704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T22:03:28.159653Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.159653Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:15fa6d45ba6c7ad9146f3559977e91955ca447f153ad129b51103ad844673692","observation_id":"4915f496-4c8b-48cd-a4fb-93f90b371a93","resolution":{"observed_at":"2026-08-05T22:03:28.159653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15778","last_updated":"2026-05-15T04:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T16:34:01Z","title":"Stabilizing Knowledge, Promoting Reasoning: Dual-Token Constraints for RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15778","snapshot_observed_at":"2026-08-05T22:03:28.164240Z","title":"Stabilizing knowledge, promoting reasoning: Dual-token constraints for rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.164240Z"},"links":{"cited_paper":"/paper/2507.15778","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:222e174a795ed2f4c6b8e0e74a8abea1d709252d7eb0f2fc4a9c554838c76f37","observation_id":"d8f702a4-4f9d-4541-ab53-b33821fc020f","resolution":{"observed_at":"2026-08-05T22:03:28.164240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:03:28.658480Z","title":"Not everything is all you need: Toward low-redundant optimization for large language model alignment","venue":null,"work_id":"db32edce-34bf-43ae-8ee8-d48979ff565a","year":2024},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.168268Z"},"links":{"citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:9688bd8c5f4862bd62687cc03b3eef94894d37fa50c3153850e8cd6a87878eb9","observation_id":"8ab8723e-19b3-466a-9f43-335a577da71b","resolution":{"observed_at":"2026-08-05T22:03:28.664973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.09977","last_updated":"2020-02-27T07:36:47Z","snapshot_observed_at":"2026-08-04T13:03:06.820772Z","submitted_at":"2020-01-27T18:53:15Z","title":"Towards a Human-like Open-Domain Chatbot","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.09977","snapshot_observed_at":"2026-08-05T22:03:28.172143Z","title":"Towards a human-like open-domain chatbot","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.172143Z"},"links":{"cited_paper":"/paper/2001.09977","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:80116232ae76ea26e1d172eea834fb552206dde5f06a554ea854cdc631b8e916","observation_id":"14e94b11-8757-47ad-a607-6a1e15eaeee5","resolution":{"observed_at":"2026-08-05T22:03:28.172143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-09T07:55:48.130608Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-05T22:03:28.176482Z","title":"Maximizing confidence alone improves reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.176482Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:3dc7331274f37a234d49ce2daca9ca6986168517258737343b6678b17cc51d5c","observation_id":"68da4352-c443-4b1c-972e-2e4d88fc095d","resolution":{"observed_at":"2026-08-05T22:03:28.176482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T22:03:28.180681Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.180681Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:127e1b350db7b6ee04619cfdffa1cd819cf8ebc88a4d7b7300c16b3e328e8628","observation_id":"93f1999f-6b2b-455f-b6bb-c20fc753d306","resolution":{"observed_at":"2026-08-05T22:03:28.180681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-08-09T18:26:12.869738Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T22:03:28.184746Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.184746Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:275860c81ac1aa91ae0e0758110def754aae30408a2979d820bc069f2ef4fdad","observation_id":"017bbefa-64cf-4014-b67b-1bb109992938","resolution":{"observed_at":"2026-08-05T22:03:28.184746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19849","last_updated":"2025-07-26T07:53:11Z","snapshot_observed_at":"2026-07-06T22:03:15.296567Z","submitted_at":"2025-07-26T07:53:11Z","title":"Agentic Reinforced Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19849","snapshot_observed_at":"2026-08-05T22:03:28.188682Z","title":"Agentic reinforced policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T22:03:28.188682Z"},"links":{"cited_paper":"/paper/2507.19849","citing_paper":"/paper/2508.07534"},"observation_digest":"sha256:3e92a21fd92123fdc3910d1a03748878ae4c5c66e6651c8510c35086e782391c","observation_id":"fca777cb-58e4-41ec-8d83-733f6ba0eeca","resolution":{"observed_at":"2026-08-05T22:03:28.188682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07534","last_updated":"2025-08-16T10:01:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T19:53:24.859763Z","submitted_at":"2025-08-11T01:26:16Z","title":"From Trial-and-Error to Improvement: A Systematic Analysis of LLM Exploration Mechanisms in RLVR"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 3 inbound Pith citation observations for arXiv:2508.07534."}