{"as_of":"2026-08-22T22:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdf57875aa63c1c2dc482608483907b1b82026e76a0a67a2229c7653d77c92f2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":48,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:59:21.875260Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T04:05:55.456269Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T18:46:11.571831Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2504.13818"},"observation_digest":"sha256:3e33ec34237f051a709914945c6bf67c40b3dd0c99e9d19c019d6d58f2e25734","observation_id":"f3cfd3a9-54be-4a41-b964-576ef5d6a952","resolution":{"observed_at":"2026-05-22T18:46:57.054014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-16T00:59:21.875260Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.02391","last_updated":"2025-05-05T06:26:00Z","snapshot_observed_at":"2026-08-21T16:22:34.302580Z","submitted_at":"2025-05-05T06:26:00Z","title":"Optimizing Chain-of-Thought Reasoners via Gradient Variance Minimization in Rejection Sampling and RL","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-16T00:59:21.875260Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.02391"},"observation_digest":"sha256:c31917d1d31c2f39c477c513ccfd22c67253fa8f924e8698c462bfd6c4e0f799","observation_id":"a861f957-35dc-4297-b7ef-48b40dc9a42e","resolution":{"observed_at":"2026-08-16T00:59:21.875260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T23:13:33.633613Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-08-18T03:20:04.325807Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:13:33.633613Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.05315"},"observation_digest":"sha256:a38fbe16790e06ea772155054c42496413cae1711f010134d93de16ba77fb2d6","observation_id":"1044172e-f93b-435e-aac4-4ae269e5bcd1","resolution":{"observed_at":"2026-08-15T23:13:33.633613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:40:13.040337Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12346","last_updated":"2025-05-18T10:20:59Z","snapshot_observed_at":"2026-08-16T10:20:08.742919Z","submitted_at":"2025-05-18T10:20:59Z","title":"SEED-GRPO: Semantic Entropy Enhanced GRPO for Uncertainty-Aware Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:40:13.040337Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.12346"},"observation_digest":"sha256:7ef897809938f29a9433bb2a86a5940cb61e163e6d78e5367ee58fde6e96cdb4","observation_id":"7825dc23-4a1e-4b4f-85c6-2153f653c563","resolution":{"observed_at":"2026-08-15T20:40:13.040337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:29:01.530228Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12929","last_updated":"2025-05-19T10:14:08Z","snapshot_observed_at":"2026-08-19T21:06:52.768271Z","submitted_at":"2025-05-19T10:14:08Z","title":"Do Not Let Low-Probability Tokens Over-Dominate in RL for LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:29:01.530228Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.12929"},"observation_digest":"sha256:f89f454a32a0266682ab19c12d16cdc06aa326528d7dba6ae9a34f6fdf4d5dbc","observation_id":"ead49eaa-8eb3-46c2-b3bd-ebb996ea348c","resolution":{"observed_at":"2026-08-15T20:29:01.530228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T15:44:35.621729Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-18T17:17:03.017013Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:35.621729Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:fb62cb7f156506fe298bdecbe8a8880529ce8f8c688fa82196aa815b3dcb0947","observation_id":"007b1964-85c9-4886-b1c9-f9788c4ad213","resolution":{"observed_at":"2026-08-07T15:44:35.621729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2505.17086","last_updated":"2026-04-14T00:27:30Z","snapshot_observed_at":"2026-08-14T10:49:19.013711Z","submitted_at":"2025-05-20T18:33:03Z","title":"Advancing Multi-Agent RAG Systems with Minimalist Reinforcement Learning","version":4},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-22T13:34:27.152447Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.17086"},"observation_digest":"sha256:d7f02d4d3b0daaaae51f3817aa2d03b3d27565b711b2f025543090d53d038024","observation_id":"55773bad-37ca-41b8-a1eb-2acc1865b435","resolution":{"observed_at":"2026-05-22T13:34:53.196041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T14:16:35.860086Z","title":"A minimalist approach to llm reasoning: From rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-19T14:21:57.125518Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:35.860086Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:eb09159bf9f6cce8a35bd268e520d423c65cc547a8f5f43f66dd2b53860ad64a","observation_id":"bc56ceb1-ca1e-45ab-a9e7-534e7fc3ea92","resolution":{"observed_at":"2026-08-07T14:16:35.860086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T11:33:56.370913Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-14T16:24:43.409019Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:56.370913Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:e6126dce99e6302fa76bff31ab7430b2b32ee42717a167f922de7c71726bd2f2","observation_id":"b7f103ad-20e3-4ede-b2fb-bba1a62b64ea","resolution":{"observed_at":"2026-08-07T11:33:56.370913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T05:01:24.239657Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-19T22:56:54.842002Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.239657Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:70c553854040e44603f2a7a9c1eefb18aee7b6b88c370b1765bb3319e7acdd7a","observation_id":"962e3e5d-9e77-4b1e-aa22-9c407beb8a47","resolution":{"observed_at":"2026-08-07T05:01:24.239657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-07T10:23:21.148418Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11091","last_updated":"2025-08-19T20:44:16Z","snapshot_observed_at":"2026-08-21T12:24:12.041357Z","submitted_at":"2025-06-05T18:42:57Z","title":"Customizing Speech Recognition Model with Large Language Model Feedback","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:23:21.148418Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.11091"},"observation_digest":"sha256:417c44dfef58bd21be2b78800c79f78e859ff829f7e5018b071dcfa0ccab5993","observation_id":"93597800-d7a9-4053-93fb-d358917a779b","resolution":{"observed_at":"2026-08-07T10:23:21.148418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T20:07:05.118325Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13358","last_updated":"2025-06-16T10:57:58Z","snapshot_observed_at":"2026-08-21T21:33:17.034034Z","submitted_at":"2025-06-16T10:57:58Z","title":"Socratic RL: A Novel Framework for Efficient Knowledge Acquisition through Iterative Reflection and Viewpoint Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:07:05.118325Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.13358"},"observation_digest":"sha256:8e7f5044924cafe8efd7ed3860e890908a7c0c23ac96ca5af629e90696641452","observation_id":"130bbb4e-c597-480b-8b5d-2e281be011ba","resolution":{"observed_at":"2026-08-15T20:07:05.118325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T19:05:16.165898Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17913","last_updated":"2026-07-21T05:30:48Z","snapshot_observed_at":"2026-08-20T02:24:43.461933Z","submitted_at":"2025-06-22T06:30:52Z","title":"Learning, Reasoning, Refinement: A Framework for Kahneman's Dual-System Intelligence in GUI Agents","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:05:16.165898Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.17913"},"observation_digest":"sha256:5e9a2a00397eec9a1a15ae94e50e5d03e9aaabb5b3bb81e5f1f165a3b53d1763","observation_id":"02e451e0-3775-48b3-b6f6-f7ce19f80b58","resolution":{"observed_at":"2026-08-15T19:05:16.165898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-06T23:28:40.648243Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18237","last_updated":"2025-06-23T02:06:04Z","snapshot_observed_at":"2026-08-22T11:28:24.087485Z","submitted_at":"2025-06-23T02:06:04Z","title":"AdapThink: Adaptive Thinking Preferences for Reasoning Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:40.648243Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2506.18237"},"observation_digest":"sha256:19228a0aab415ad1eae50a4cad841be6b7491f35ef70c789a6962af1d0bb289a","observation_id":"dfe89364-6f1e-4824-b5d1-26b29b027228","resolution":{"observed_at":"2026-08-06T23:28:40.648243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-06T16:34:25.253465Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-15T15:23:09.345799Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.253465Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:233be5446a8b4d93b556a6697abf52f6c39ca5c0ca9a3362e6eafe59fe1e62ed","observation_id":"11c90913-72bb-4836-a257-2e2879251b27","resolution":{"observed_at":"2026-08-06T16:34:25.253465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-05T23:10:24.525759Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-20T04:52:52.301653Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.525759Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:e9f0534559cdceee636f3349bc9b84666fd93604c4176dd0f837d9fedf7c6bf8","observation_id":"448730c8-885a-4819-9491-e48d9a58ada9","resolution":{"observed_at":"2026-08-05T23:10:24.525759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T17:32:59.005705Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11995","last_updated":"2025-08-16T09:46:04Z","snapshot_observed_at":"2026-08-20T12:04:20.322219Z","submitted_at":"2025-08-16T09:46:04Z","title":"AgentCDM: Enhancing Multi-Agent Collaborative Decision-Making via ACH-Inspired Structured Reasoning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:32:59.005705Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.11995"},"observation_digest":"sha256:0bd3bfc1716fc292fc6989cdb69b1dd4809c80f54ac1f00edaa5ae88b8867aaf","observation_id":"8784bc97-94c8-4a9b-8e9f-ca944336d9f3","resolution":{"observed_at":"2026-08-15T17:32:59.005705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-15T17:19:46.684636Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13023","last_updated":"2025-08-18T15:41:16Z","snapshot_observed_at":"2026-08-20T21:14:49.624963Z","submitted_at":"2025-08-18T15:41:16Z","title":"G$^2$RPO-A: Guided Group Relative Policy Optimization with Adaptive Guidance","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:19:46.684636Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.13023"},"observation_digest":"sha256:0756907382601c0d7aede487fb442c275169b8e279b30ed28fe9f787fc96cc9e","observation_id":"30cb60d8-9c69-45c1-8da3-8c4b6d8d5319","resolution":{"observed_at":"2026-08-15T17:19:46.684636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2508.20697","last_updated":"2026-08-04T09:31:07Z","snapshot_observed_at":"2026-08-07T23:09:05.524726Z","submitted_at":"2025-08-28T12:07:11Z","title":"Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T20:40:44.496392Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2508.20697"},"observation_digest":"sha256:25ce8899088aac3af4346d7aee3fc64404a0805b73abab64a36e81a254c25bb5","observation_id":"bb2d36c3-c7c9-4a0d-9b02-8641cb2cc399","resolution":{"observed_at":"2026-05-18T20:41:50.456853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-08-15T01:33:58.861430Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-21T22:38:57.833414Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2509.03403"},"observation_digest":"sha256:f359aa82786bbef07a71eecda86c4efcb30ff23c1c04d198f2f1308a7ffbc39a","observation_id":"0c7116e4-8cdc-42c2-9271-48c094d9c972","resolution":{"observed_at":"2026-05-21T22:40:43.244574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2509.16117","last_updated":"2026-02-16T17:14:06Z","snapshot_observed_at":"2026-08-17T17:00:34.924478Z","submitted_at":"2025-09-19T16:09:33Z","title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T16:54:30.953199Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2509.16117"},"observation_digest":"sha256:efab0888a9e294e8c58421da652cf27c77eb0c1b0260f11999207f2d5d7d92b3","observation_id":"3a903c09-9f27-48b5-996a-8758fa183abe","resolution":{"observed_at":"2026-05-13T16:54:30.986262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-04T11:38:53.871009Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.04019","last_updated":"2026-07-23T05:31:21Z","snapshot_observed_at":"2026-08-18T02:44:54.090545Z","submitted_at":"2025-10-05T03:53:16Z","title":"Simple Policy Gradients for Reasoning with Diffusion Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:53.871009Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2510.04019"},"observation_digest":"sha256:aa1a8a359800b3cc2515d4fcab5dc93f09cf19ee91d8af3943b29e2314daddf3","observation_id":"9bb53df9-d8d6-4975-bdc3-ab161ec4c708","resolution":{"observed_at":"2026-08-04T11:38:53.871009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-04T08:49:34.587109Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.18874","last_updated":"2026-06-26T02:22:44Z","snapshot_observed_at":"2026-08-12T17:11:52.723281Z","submitted_at":"2025-10-21T17:59:41Z","title":"Retaining by Doing: The Role of On-Policy Data in Mitigating Forgetting","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T08:49:34.587109Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2510.18874"},"observation_digest":"sha256:808b4a640e18d42d908ce22f108f0126cd622cc56766478bc052c7dcd008195d","observation_id":"3d40d08e-cbcd-4cba-a805-8b25870ed109","resolution":{"observed_at":"2026-08-04T08:49:34.587109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-03T23:33:50.580515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05385","last_updated":"2026-07-23T06:36:18Z","snapshot_observed_at":"2026-08-17T14:05:47.398482Z","submitted_at":"2025-11-07T16:08:34Z","title":"TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:50.580515Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2511.05385"},"observation_digest":"sha256:bca93c70e01ff83d58c4e66b0194c68357ff13621637c1b59d687014aee79d74","observation_id":"e2e87cb3-0435-455e-8590-bda005b55f76","resolution":{"observed_at":"2026-08-03T23:33:50.580515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2604.26326","last_updated":"2026-05-10T00:50:42Z","snapshot_observed_at":"2026-08-13T14:50:25.704734Z","submitted_at":"2026-04-29T06:16:33Z","title":"Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T13:34:06.461850Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2604.26326"},"observation_digest":"sha256:cc16d942be5822886c8a8b8912ef525397e397a4638d4718164dfe9e99dd60a1","observation_id":"acc3680d-d292-4990-a7da-29ed62b2cacd","resolution":{"observed_at":"2026-05-12T08:51:25.636355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2604.26326","last_updated":"2026-05-10T00:50:42Z","snapshot_observed_at":"2026-08-13T14:50:25.704734Z","submitted_at":"2026-04-29T06:16:33Z","title":"Addressing Performance Saturation for LLM RL via Precise Entropy Curve Control","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T01:56:51.940356Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2604.26326"},"observation_digest":"sha256:1a39f1a20d2fd1749027c7d48c3cf02f02ca08fe2ab00fb7f8ba423d35261884","observation_id":"73b77fc9-59fc-469e-91af-c9034311ff2f","resolution":{"observed_at":"2026-05-12T07:46:32.380758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T07:00:32.206081Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:28eb0b05643e8675a9b73726dbc1c9d37394af07c9bca07e2a81079d4d37bdba","observation_id":"1755dd5f-1fb3-48ea-8ae5-caa2491a1599","resolution":{"observed_at":"2026-05-12T10:11:28.859103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2604.28005","last_updated":"2026-05-15T18:39:07Z","snapshot_observed_at":"2026-08-15T11:11:20.405441Z","submitted_at":"2026-04-30T15:27:34Z","title":"Kernelized Advantage Estimation: From Nonparametric Statistics to LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T23:47:53.282259Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2604.28005"},"observation_digest":"sha256:dd0570ff79fcb9868212cf52e9d5b06e34b9da5fd05005a160b85d1559b6cac7","observation_id":"630449dd-b80d-4aa3-a288-bfdc3eeaca58","resolution":{"observed_at":"2026-05-20T23:49:14.948536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.00347","last_updated":"2026-05-01T02:05:56Z","snapshot_observed_at":"2026-08-11T00:38:42.624588Z","submitted_at":"2026-05-01T02:05:56Z","title":"Odysseus: Scaling VLMs to 100+ Turn Decision-Making in Games via Reinforcement Learning","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T20:22:58.061772Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.00347"},"observation_digest":"sha256:a02d9e96bccddf29523d4445f64d31ef3fe2a8d9b937b9b82abcd705a7c7839c","observation_id":"4e3f625f-f911-47dc-913c-9b7283007d79","resolution":{"observed_at":"2026-05-11T15:16:09.087260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.05965","last_updated":"2026-05-07T10:11:51Z","snapshot_observed_at":"2026-08-13T12:51:35.018968Z","submitted_at":"2026-05-07T10:11:51Z","title":"Beyond Uniform Credit Assignment: Selective Eligibility Traces for RLVR","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-09T15:39:54.001327Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.05965"},"observation_digest":"sha256:c923dea14e9ea90196018769fb9de3a2896e826373b6487bab62d919b4633172","observation_id":"27f16019-f5ab-482c-a3c3-229879c8f308","resolution":{"observed_at":"2026-05-11T16:36:10.409003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:0bf10c3ab86232dd3b95268fb90bfa12ca3a3faca6a419fda0449c51a42d3da2","observation_id":"8904c37e-bae8-43f4-b1f4-e6b1b9576a75","resolution":{"observed_at":"2026-05-11T03:55:56.827682Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-15T21:47:26.504858Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:ffa031b1b72500a722b0c77131e014b73576900acb106913046bb7d867d23e47","observation_id":"ac7f4f7a-08a9-4ae7-9c10-ac45239fb51b","resolution":{"observed_at":"2026-05-11T04:00:55.092691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:28:18.615371Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:75f492ad22995e3568f17f6ad42eca36b7be66d223fbbaaf5f4ce1b0a9a7adcf","observation_id":"cffefd4d-5467-42c3-b666-e5c677216762","resolution":{"observed_at":"2026-05-13T01:47:05.243802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.11505","last_updated":"2026-05-13T06:41:19Z","snapshot_observed_at":"2026-08-12T14:20:35.464221Z","submitted_at":"2026-05-12T04:25:41Z","title":"Selective Off-Policy Reference Tuning with Plan Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T21:20:24.066520Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.11505"},"observation_digest":"sha256:5a04f80b4601a30a08dab97a4ff02bc0b33804b2aa64bbb45ba0ba6c11a0568f","observation_id":"04ef7fec-55a2-469b-b11e-13f85b769347","resolution":{"observed_at":"2026-05-14T21:22:59.403633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-08-14T08:18:35.465148Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-13T07:03:00.503644Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:bb74c351d0b3a5c0433281056b728c9f8b16cf83efc9c9dea94cb51dfa48528e","observation_id":"6d45c1f7-88b7-4b72-9a5e-75ef342eb4fc","resolution":{"observed_at":"2026-05-13T07:07:28.062118Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.11726","last_updated":"2026-05-13T15:38:02Z","snapshot_observed_at":"2026-08-14T08:18:35.465148Z","submitted_at":"2026-05-12T08:09:42Z","title":"Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-14T21:06:01.667173Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.11726"},"observation_digest":"sha256:a4167a207bbbf21c5609852c152e6d216486648b578d625fb332970dceed45c4","observation_id":"f3cd6cc3-8198-42f8-b0c1-5d701390201b","resolution":{"observed_at":"2026-05-14T21:19:28.199683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.20865","last_updated":"2026-05-20T08:01:01Z","snapshot_observed_at":"2026-08-12T12:03:15.752168Z","submitted_at":"2026-05-20T08:01:01Z","title":"Multi-Step Likelihood-Ratio Correction for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T05:55:45.654673Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2605.20865"},"observation_digest":"sha256:84a5b6ff7f4776de05454a054c4fdacb730877a1e9131eb4da8ab9aea0a7e7aa","observation_id":"fd58e815-33b8-4c2b-a799-7d7328ae7e9f","resolution":{"observed_at":"2026-05-21T05:59:41.063061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.00257","last_updated":"2026-05-29T18:42:06Z","snapshot_observed_at":"2026-08-16T13:02:47.619773Z","submitted_at":"2026-05-29T18:42:06Z","title":"ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T22:54:53.415067Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.00257"},"observation_digest":"sha256:e8e6bfe1a83d02310e18d8f8ebed03ec7fe24b0f004db0fe98d6a7ada0c53f2f","observation_id":"0aee1525-3fe3-446e-a08f-0a4820de4161","resolution":{"observed_at":"2026-07-01T19:16:00.804526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.02812","last_updated":"2026-06-01T19:30:07Z","snapshot_observed_at":"2026-08-17T15:48:29.955557Z","submitted_at":"2026-06-01T19:30:07Z","title":"Traj-Evolve: A Self-Evolving Multi-Agent System for Patient Trajectory Modeling in Lung Cancer Early Detection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-28T14:20:06.381334Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.02812"},"observation_digest":"sha256:91427371f1aa212c9cce74185ae6a70343432795dedc7401ba24f269e7606d2c","observation_id":"c20fbf8a-6285-40a2-b777-36c0e8059a36","resolution":{"observed_at":"2026-07-01T23:26:22.844157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.04560","last_updated":"2026-06-04T06:53:10Z","snapshot_observed_at":"2026-08-13T03:34:48.875235Z","submitted_at":"2026-06-03T07:47:47Z","title":"Rollout-Level Advantage-Prioritized Experience Replay for GRPO","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T07:43:21.284574Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.04560"},"observation_digest":"sha256:2d869a3d7e642d4a0853a1ee97a09df09a83d99b9676ef411efcd07a8b603956","observation_id":"247f0921-085c-40d3-bb1a-5832dc6274cc","resolution":{"observed_at":"2026-07-02T06:06:41.052519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.05597","last_updated":"2026-08-07T17:58:32Z","snapshot_observed_at":"2026-08-15T16:07:45.641899Z","submitted_at":"2026-06-04T02:18:44Z","title":"AsyncWebRL: Efficient Asynchronous Reinforcement Learning for Multi-Step Visual Web Agents","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T02:45:25.694378Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.05597"},"observation_digest":"sha256:14f1b6b237f9a6a1a12d60bc2908bb223286793af7a746d12cb0460381c6f670","observation_id":"92d6a179-4695-4e99-92a4-c596e43b8601","resolution":{"observed_at":"2026-07-02T11:56:55.521293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:77a067c37ca188c5c8341236deb24a2b86725b847cc8717814579a34abb3d804","observation_id":"842d94d0-100c-48b9-8371-829985f2993b","resolution":{"observed_at":"2026-07-03T20:38:56.067368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.18307","last_updated":"2026-06-16T07:21:49Z","snapshot_observed_at":"2026-07-06T23:53:45.117607Z","submitted_at":"2026-06-16T07:21:49Z","title":"DRIFT: Refining Instruction Data via On-Policy Data Attribution","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T01:57:05.784589Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.18307"},"observation_digest":"sha256:d50b9e8a3556fa7d84cb4e425d5df96ccccc4495a962be578a25b2bada2ff021","observation_id":"08ff4005-a93c-4e45-97dc-15cb1ad52b5a","resolution":{"observed_at":"2026-07-03T19:18:54.722039Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:0a362eb4e0e6bf269d5453fb933b4999c3f2dedf6ce908d95e79a3ba1d3c075d","observation_id":"7d607ce7-cda3-4fb0-9d51-f107ba4b1af5","resolution":{"observed_at":"2026-07-04T09:09:43.575477Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":"2504.11343","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-07-09T04:05:55.456269Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce.arXiv preprint arXiv:2504.11343","venue":"cs.LG","work_id":"90392907-b8b0-4771-9ac8-6cd50245b1dd","year":2025},"citing_paper":{"arxiv_id":"2607.07646","last_updated":"2026-07-08T17:04:42Z","snapshot_observed_at":"2026-08-15T03:32:00.182027Z","submitted_at":"2026-07-08T17:04:42Z","title":"RL Post-Training Builds Compositional Reasoning Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T04:04:13.942267Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2607.07646"},"observation_digest":"sha256:42985a89728e2eaf6d9ed77ee9f5c88240b5e0d71e2071e842aa2043927c6519","observation_id":"6299d2f4-a2e8-4d50-99c9-9b112124ab68","resolution":{"observed_at":"2026-07-09T04:05:55.457832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-02T04:32:37.522325Z","title":"arXiv preprint arXiv:2504.11343 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13683","last_updated":"2026-07-15T10:26:26Z","snapshot_observed_at":"2026-08-17T02:01:40.814108Z","submitted_at":"2026-07-15T10:26:26Z","title":"Self-Evolving Agent Harnesses via Gated Semantic Quality-Diversity","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T04:32:37.522325Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2607.13683"},"observation_digest":"sha256:fa3b3be118b2ca3f5505c3bcb5a66cf56ae0c0f145c3ef53d8a2ec35a2b39e83","observation_id":"9d906ae0-a2f9-433e-821b-42cf4472e9ba","resolution":{"observed_at":"2026-08-02T04:32:37.522325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-02T14:45:23.980380Z","title":"arXiv preprint arXiv:2504.11343 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16205","last_updated":"2026-05-07T13:16:09Z","snapshot_observed_at":"2026-08-05T18:20:48.142001Z","submitted_at":"2026-05-07T13:16:09Z","title":"It Takes 8 Tokens: Weak-to-Strong Off-Policy RL via Auxiliary Branches","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T14:45:23.980380Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2607.16205"},"observation_digest":"sha256:28dc067b4cac91cefa70a772dc7025516d49bd41518350287bca8b2ba7773520","observation_id":"8b0b7d76-777d-494d-a718-80aaea0fcccf","resolution":{"observed_at":"2026-08-02T14:45:23.980380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11343","snapshot_observed_at":"2026-08-01T13:54:23.273919Z","title":"arXiv preprint arXiv:2504.11343 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18979","last_updated":"2026-07-21T11:14:33Z","snapshot_observed_at":"2026-08-20T09:37:03.506510Z","submitted_at":"2026-07-21T11:14:33Z","title":"Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T13:54:23.273919Z"},"links":{"cited_paper":"/paper/2504.11343","citing_paper":"/paper/2607.18979"},"observation_digest":"sha256:203e8f629a7c8548d0fba34dc5603ef59d7f9fc4752955f0ebf55a84430a99af","observation_id":"f9475cb6-7154-4997-af99-64cca06655f9","resolution":{"observed_at":"2026-08-01T13:54:23.273919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.11343/citation-record","integrity":"/paper/2504.11343/integrity","json":"/paper/2504.11343/citation-record.json","paper":"/paper/2504.11343"},"outbound":[],"paper":{"arxiv_id":"2504.11343","last_updated":"2025-06-12T06:03:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-22T06:34:49.970218Z","submitted_at":"2025-04-15T16:15:02Z","title":"A Minimalist Approach to LLM Reasoning: from Rejection Sampling to Reinforce"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 48 inbound Pith citation observations for arXiv:2504.11343."}