{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3270c751d25e772b4fe825238e7a3fe936fb649e1d698a9c8854e0b315af7939","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":42,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:44:32.385679Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:27:36.759210Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-08-10T09:42:17.185681Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":276,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:c0010e303e1adcdb91acbed08621fdf5612eeb14b2ca48907434dc1a5dbfba4c","observation_id":"e60bd50d-4186-4064-8860-005c7aed1ee1","resolution":{"observed_at":"2026-05-13T01:36:24.483767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T00:26:48.291431Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2504.13958"},"observation_digest":"sha256:2b4761ca876b5f183f764e7262b30562b9453ec5ef0d7d3aad377f020442d78f","observation_id":"8653614e-8e49-4678-92cc-08bf6d9a94ad","resolution":{"observed_at":"2026-05-14T00:26:48.445619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T15:44:32.385679Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-09T18:13:25.628969Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:32.385679Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:d265ef5c777fab056ed8df356c4f6fefe2d5d1eaed876469840e48afcd60b94e","observation_id":"9418ddc7-8284-4590-81cc-d8bc205438cb","resolution":{"observed_at":"2026-08-07T15:44:32.385679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T15:06:05.361350Z","title":"LIMR: less is more for RL scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.16410","last_updated":"2025-05-22T09:00:19Z","snapshot_observed_at":"2026-08-07T20:42:11.938642Z","submitted_at":"2025-05-22T09:00:19Z","title":"Tool-Star: Empowering LLM-Brained Multi-Tool Reasoner via Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:05.361350Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.16410"},"observation_digest":"sha256:7906e82dae89285cfae22d1ddc273b7f5aacb387b56640d737f8210f1dc23ff2","observation_id":"d0dcaede-b418-4ca1-974f-bb7ca676e1a3","resolution":{"observed_at":"2026-08-07T15:06:05.361350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T14:41:41.222191Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17988","last_updated":"2025-08-05T11:46:13Z","snapshot_observed_at":"2026-08-09T20:50:22.177201Z","submitted_at":"2025-05-23T14:55:22Z","title":"Towards Revealing the Effectiveness of Small-Scale Fine-tuning in R1-style Reinforcement Learning","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:41:41.222191Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.17988"},"observation_digest":"sha256:448f5d59a4610abe333872e737d0f9fe0c370569623c6e9f666de3a26af89382","observation_id":"6f9b73f4-d090-4ab2-93a1-d8eea78a0da2","resolution":{"observed_at":"2026-08-07T14:41:41.222191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T13:46:40.358276Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21067","last_updated":"2025-05-27T11:52:41Z","snapshot_observed_at":"2026-08-07T16:09:26.563632Z","submitted_at":"2025-05-27T11:52:41Z","title":"Why Distillation can Outperform Zero-RL: The Role of Flexible Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.358276Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.21067"},"observation_digest":"sha256:03def5184136f8ccfdfb1d1b12023a4394689525fedbd52dcc6a4b9b3103ea0a","observation_id":"12b3dd73-f9b7-4c0c-abc1-d33bcdacbf4e","resolution":{"observed_at":"2026-08-07T13:46:40.358276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T13:10:32.954737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22626","last_updated":"2025-09-09T06:38:19Z","snapshot_observed_at":"2026-08-09T23:21:52.556876Z","submitted_at":"2025-05-28T17:45:05Z","title":"SCIZOR: A Self-Supervised Approach to Data Curation for Large-Scale Imitation Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:10:32.954737Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.22626"},"observation_digest":"sha256:2d283fa47d225c1ec8bfa52369d588de31bff5d1f93a79ff43db5dc7883d4889","observation_id":"d3903c7a-4f40-4b10-bb8d-1917083a9ea1","resolution":{"observed_at":"2026-08-07T13:10:32.954737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T12:39:56.430228Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24098","last_updated":"2025-05-30T01:00:34Z","snapshot_observed_at":"2026-08-09T17:58:14.173767Z","submitted_at":"2025-05-30T01:00:34Z","title":"HardTests: Synthesizing High-Quality Test Cases for LLM Coding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:39:56.430228Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2505.24098"},"observation_digest":"sha256:955776687a8e78ca2ccfe9543ab363c327f2bf984f16ebaa910fd6f78afb0617","observation_id":"ba80164b-d1a3-4ad6-b274-f52d49fe5572","resolution":{"observed_at":"2026-08-07T12:39:56.430228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T12:06:25.160677Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00577","last_updated":"2025-05-31T14:22:40Z","snapshot_observed_at":"2026-08-07T22:33:33.136985Z","submitted_at":"2025-05-31T14:22:40Z","title":"Reasoning Like an Economist: Post-Training on Economic Problems Induces Strategic Generalization in LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.160677Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.00577"},"observation_digest":"sha256:799bc8dd06de1d984068f105984270d293832315f44d4731b7b972c18871bba5","observation_id":"622b3240-6a49-4b5d-ba52-4a2c48cb0687","resolution":{"observed_at":"2026-08-07T12:06:25.160677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T11:35:45.327280Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02096","last_updated":"2025-06-02T17:45:16Z","snapshot_observed_at":"2026-08-07T12:51:05.147362Z","submitted_at":"2025-06-02T17:45:16Z","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:35:45.327280Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.02096"},"observation_digest":"sha256:e998e5a8aea64bae99fe13ad716c09f33624126f610d5719581f5eff554f49a6","observation_id":"07818c08-b6e3-4a43-a672-edcb1c042834","resolution":{"observed_at":"2026-08-07T11:35:45.327280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T11:33:54.876617Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-09T22:08:47.391957Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.876617Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:5012946804e13b3aa4146339de0d9233bfe0ffd679d5d10a4488a7d4e1632c44","observation_id":"5c790190-4f4c-4b4f-a4a2-43d7f28d5c46","resolution":{"observed_at":"2026-08-07T11:33:54.876617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T05:49:36.467346Z","title":"Limr: Less is more for rl scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07104","last_updated":"2025-09-10T09:03:04Z","snapshot_observed_at":"2026-08-09T18:03:30.520806Z","submitted_at":"2025-06-08T12:18:50Z","title":"How Far Are We from Optimal Reasoning Efficiency?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:49:36.467346Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.07104"},"observation_digest":"sha256:ed93389d779ab8f8679c00933fb332111e39bb8dcde0503cefb61dc053d12aa8","observation_id":"86b8cbe4-6afc-4a59-89fe-b898730394fb","resolution":{"observed_at":"2026-08-07T05:49:36.467346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-07T05:01:24.145061Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08989","last_updated":"2025-06-10T17:02:00Z","snapshot_observed_at":"2026-08-07T04:55:03.980740Z","submitted_at":"2025-06-10T17:02:00Z","title":"SwS: Self-aware Weakness-driven Problem Synthesis in Reinforcement Learning for LLM Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:01:24.145061Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2506.08989"},"observation_digest":"sha256:4487abe0cfc91f34c7959109c268d488df7899666f89b53c9b9d0b76ee0a7aa0","observation_id":"67b2ffa4-f2eb-4445-bf66-67a400742f9d","resolution":{"observed_at":"2026-08-07T05:01:24.145061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-06T20:46:44.775814Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01951","last_updated":"2025-07-09T12:28:31Z","snapshot_observed_at":"2026-08-10T04:39:01.641296Z","submitted_at":"2025-07-02T17:58:01Z","title":"Test-Time Scaling with Reflective Generative Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:44.775814Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2507.01951"},"observation_digest":"sha256:95728bc72487ef4d399e40768e40deceaa95532a31bc65f84f7d99d433aec0ec","observation_id":"960841b0-a8eb-43b4-ae90-d6e7ef6b0273","resolution":{"observed_at":"2026-08-06T20:46:44.775814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-06T19:16:12.582797Z","title":"Limr: Less is more for rl scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06127","last_updated":"2025-07-08T16:14:17Z","snapshot_observed_at":"2026-08-08T15:07:59.924275Z","submitted_at":"2025-07-08T16:14:17Z","title":"PrefixAgent: An LLM-Powered Design Framework for Efficient Prefix Adder Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:12.582797Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2507.06127"},"observation_digest":"sha256:3195231ca05840258ddd796d4b3041ddcaa0c63999107a59b67a8b267c535ae7","observation_id":"0bd2e522-1f8c-4017-9ab6-ba400e554300","resolution":{"observed_at":"2026-08-06T19:16:12.582797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-06T19:07:36.105216Z","title":"Hugging Face repository, 13:9","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06573","last_updated":"2025-07-09T06:05:28Z","snapshot_observed_at":"2026-08-07T21:25:23.216182Z","submitted_at":"2025-07-09T06:05:28Z","title":"From Data-Centric to Sample-Centric: Enhancing LLM Reasoning via Progressive Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:07:36.105216Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2507.06573"},"observation_digest":"sha256:b51d3f4b62ffdac6c4bc292a91cf292c5cbe4a2a059273cfc9bbc75cb736b4e5","observation_id":"b894d50c-c028-4d0c-9c0d-fb4703238dab","resolution":{"observed_at":"2026-08-06T19:07:36.105216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2508.10164","last_updated":"2026-04-15T15:39:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-13T20:00:09Z","title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T22:26:52.748349Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2508.10164"},"observation_digest":"sha256:f0bebdee2d4da7928894ef0e40f9227ff28a5fe97e70ce2fbf22b734e6eb8ea9","observation_id":"fd345c14-e1f0-4cdf-9d3b-80b3094c52e1","resolution":{"observed_at":"2026-05-18T22:31:53.188452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-05T16:11:23.150929Z","title":"LIMR : Less is more for RL scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18914","last_updated":"2025-08-26T10:38:18Z","snapshot_observed_at":"2026-08-09T05:20:21.384911Z","submitted_at":"2025-08-26T10:38:18Z","title":"FormaRL: Enhancing Autoformalization with no Labeled Data","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:11:23.150929Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2508.18914"},"observation_digest":"sha256:75603e07527e0871f736738c869e43ce398debe02d3f004b0a6412b3f28550b2","observation_id":"9b49024a-7409-4cfe-968d-bb5055889cf4","resolution":{"observed_at":"2026-08-05T16:11:23.150929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-04T22:56:02.527244Z","title":"Xinyu Lin, Wenjie Wang, Yongqi Li, Shuo Yang, Fuli Feng, Yinwei Wei, and Tat-Seng Chua","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06948","last_updated":"2026-05-30T09:01:09Z","snapshot_observed_at":"2026-08-04T22:56:01.963927Z","submitted_at":"2025-09-08T17:58:02Z","title":"Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T22:56:02.527244Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2509.06948"},"observation_digest":"sha256:710aacbba8d85501c2a4196676d2a9a9c4fe49a46f23cd00eb4037471538dd5d","observation_id":"b7d6496c-3f15-4a00-b1e7-a273af4f0373","resolution":{"observed_at":"2026-08-04T22:56:02.527244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":289,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:b102663b521f3a963117a5144f4d55e99a3bb81e391a15e3479dd9f8367dc0a6","observation_id":"8dcc5459-bfb3-4a16-b94e-a0db283a9778","resolution":{"observed_at":"2026-05-18T00:02:24.776325Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-04T10:40:46.397811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09278","last_updated":"2026-06-28T16:27:56Z","snapshot_observed_at":"2026-08-08T22:59:31.970086Z","submitted_at":"2025-10-10T11:21:09Z","title":"CLARity: Reasoning Consistency Alone Can Teach Reinforced Experts","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T10:40:46.397811Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2510.09278"},"observation_digest":"sha256:434886d1ded5c0fa63158d48928d0e253d14b1ac04320940d65c7fd93a9cb7f0","observation_id":"3560fc99-bac1-426f-a0dc-af3069e0e8f4","resolution":{"observed_at":"2026-08-04T10:40:46.397811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2511.07940","last_updated":"2026-04-26T13:09:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-11T07:43:13Z","title":"ISExplore:Informative Segment Selection for Efficient Personalized 3D Talking Face Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:08:28.730095Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2511.07940"},"observation_digest":"sha256:c8486c30b9d3178cf2495d5cff488152a92e9c0b60b3c5035d09c5d1a3f9e97e","observation_id":"aeaa8e7a-bb26-4076-88c4-0d3f498b73b9","resolution":{"observed_at":"2026-05-18T00:10:32.307963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2602.01970","last_updated":"2026-05-15T12:23:06Z","snapshot_observed_at":"2026-07-06T22:44:04.951815Z","submitted_at":"2026-02-02T11:24:36Z","title":"Small Generalizable Prompt Predictive Models Can Steer Efficient RL Post-Training of Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T14:09:26.842696Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2602.01970"},"observation_digest":"sha256:ea698adca5899985d0e1ef138fcd253ce9fed979e5375b8d99ad2f7dd147bffe","observation_id":"79bc85bb-ab27-4304-95fe-6380e188238e","resolution":{"observed_at":"2026-05-21T14:10:13.194777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2602.03452","last_updated":"2026-05-06T05:26:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-03T12:17:25Z","title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:50.793194Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2602.03452"},"observation_digest":"sha256:52d359c2b7785e47232a36df04b14214d6701ea2980108e98c2cb998bbc5f244","observation_id":"b585bddf-8bd8-4bdc-bbcd-5039a2452c41","resolution":{"observed_at":"2026-05-16T08:27:36.744086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2604.03993","last_updated":"2026-04-05T06:30:50Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:30:50Z","title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T16:58:42.129870Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2604.03993"},"observation_digest":"sha256:5cd9643ff033f494e41fa533f8287324d09837404aaed599623ab0bd31a91aa0","observation_id":"a9a9ae24-6dca-4b71-9d82-5ae649740511","resolution":{"observed_at":"2026-05-13T17:08:01.331952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:b1b1c99a47dae03381695931b10aca6fd1678970cf755812d730e5ccd54da7e3","observation_id":"9f9d1155-8352-4010-98af-7708be565f98","resolution":{"observed_at":"2026-05-10T09:23:37.517501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2604.18381","last_updated":"2026-04-20T15:04:57Z","snapshot_observed_at":"2026-08-02T10:52:14.752020Z","submitted_at":"2026-04-20T15:04:57Z","title":"Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T04:55:18.468593Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2604.18381"},"observation_digest":"sha256:1ded0aba26beca2bc2d06ac61d643f891ee207dca0fc0c653dc60100b01f6052","observation_id":"11c49c28-d055-4fb3-83ec-ea8d36bce8ba","resolution":{"observed_at":"2026-05-10T11:10:09.661693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2604.24171","last_updated":"2026-04-27T08:29:52Z","snapshot_observed_at":"2026-07-06T23:10:16.426836Z","submitted_at":"2026-04-27T08:29:52Z","title":"POCA: Pareto-Optimal Curriculum Alignment for Visual Text Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:37:41.629935Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2604.24171"},"observation_digest":"sha256:a061a3b50f26fef0c212c0416c878561ddd377100b45ba385e0a7589e4b4d15d","observation_id":"1509c011-042e-4c26-97d2-6a9e59acfd0a","resolution":{"observed_at":"2026-05-11T21:41:15.529008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2604.28020","last_updated":"2026-05-29T15:07:05Z","snapshot_observed_at":"2026-07-06T23:13:24.960159Z","submitted_at":"2026-04-30T15:39:09Z","title":"Cost-Aware Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T05:11:01.131590Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2604.28020"},"observation_digest":"sha256:d1a0a40d3839688b49e30df153f376e09ee5358cd6766c4dccbb976c49646132","observation_id":"27709112-a375-4f60-bd93-a7fc88a51927","resolution":{"observed_at":"2026-05-12T10:36:30.935572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.00015","last_updated":"2026-07-31T03:07:58Z","snapshot_observed_at":"2026-08-05T23:10:40.138310Z","submitted_at":"2026-04-18T06:22:26Z","title":"TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:28.648869Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.00015"},"observation_digest":"sha256:0bc60c0306d341518a43e7c65e226db50e53bc18d4aad61ee80a559b66b5a4f1","observation_id":"e3478c03-e531-46c3-bb5a-fdfe21ce7e40","resolution":{"observed_at":"2026-05-10T07:16:54.879375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-03T02:26:14.089922Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.00015","last_updated":"2026-07-31T03:07:58Z","snapshot_observed_at":"2026-08-05T23:10:40.138310Z","submitted_at":"2026-04-18T06:22:26Z","title":"TimeRFT: Stimulating Generalizable Time Series Forecasting for TSFMs via Reinforcement Finetuning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T02:26:14.089922Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.00015"},"observation_digest":"sha256:48597923e41958ccea49bcdb63c5681bbff89b429ad262b664185be48312bca9","observation_id":"3f4abc9e-1b48-467f-8ca3-87fd222fcaf4","resolution":{"observed_at":"2026-08-03T02:26:14.089922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.06755","last_updated":"2026-05-07T16:20:13Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T16:20:13Z","title":"Gradient Extrapolation-Based Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:08.792030Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.06755"},"observation_digest":"sha256:8e049590e5564d5cbc9ee5dbab252200a423ade8ea01c7e8a80ec09b5b542903","observation_id":"61c068fe-f799-4ba1-a511-d6928464fd8e","resolution":{"observed_at":"2026-05-11T03:55:56.798009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.08441","last_updated":"2026-05-08T20:03:19Z","snapshot_observed_at":"2026-08-02T05:33:25.541249Z","submitted_at":"2026-05-08T20:03:19Z","title":"DUET: Optimize Token-Budget Allocation for Reinforcement Learning with Verifiable Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T01:57:11.065744Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.08441"},"observation_digest":"sha256:1bd6e35a7ca930ba7386d2b1dbdcb7e6a6bf7479bd4c1a66366fbb735f6bfd22","observation_id":"91d7a693-0bc5-4807-b903-a3f5c693b9df","resolution":{"observed_at":"2026-05-12T07:46:30.076748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-07-06T23:21:21.560069Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:80456a509a816bfbcf4c346d620d129312d3671aa72aed10f3ccd953da54a128","observation_id":"d9a08857-37e8-4d7c-bba7-23faace8eda1","resolution":{"observed_at":"2026-05-12T03:16:19.290990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.15012","last_updated":"2026-05-14T16:12:30Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:12:30Z","title":"Boosting Reinforcement Learning with Verifiable Rewards via Randomly Selected Few-Shot Guidance","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T03:18:26.590871Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.15012"},"observation_digest":"sha256:21a0644e325589df934339ceb90c9c4e19f1e5deee11d498883bdbdaf53ab94a","observation_id":"fed1f1c4-eb3c-429c-a80c-6f075a26b65a","resolution":{"observed_at":"2026-05-15T03:19:43.101924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2605.28631","last_updated":"2026-05-27T15:38:09Z","snapshot_observed_at":"2026-07-06T23:38:09.179597Z","submitted_at":"2026-05-27T15:38:09Z","title":"Single-Rollout Hidden-State Dynamics for Training-Free RLVR Data Selection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T14:08:40.968105Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2605.28631"},"observation_digest":"sha256:a17a6e7c3e11fb28d1184e3667a0d489dd54193ffe16277258447a0ef43b01a6","observation_id":"e06bc65f-d8c7-46c4-9278-272df101a202","resolution":{"observed_at":"2026-06-29T14:13:30.088668Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":285,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:ffbd89c9e69601cf426ade4cc58c73fa8347dd78d663c23af2983e93b181562b","observation_id":"e27e7df0-802f-4eea-a729-f5b9523d4823","resolution":{"observed_at":"2026-07-01T20:56:13.626999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":"2502.11886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-03T04:27:36.759210Z","title":"Limr: Less is more for rl scaling.arXiv preprint arXiv:2502.11886","venue":null,"work_id":"fc61b32c-7df6-493f-8cad-8995d8e3addf","year":2025},"citing_paper":{"arxiv_id":"2606.11119","last_updated":"2026-06-09T17:16:03Z","snapshot_observed_at":"2026-07-31T16:22:30.560541Z","submitted_at":"2026-06-09T17:16:03Z","title":"TRACE: A Unified Rollout Budget Allocation Framework for Efficient Agentic Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T13:55:35.363377Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2606.11119"},"observation_digest":"sha256:802845aa72d6dd49938f502ef4942bd721b37c97cd68c9ed970323f5b107db0f","observation_id":"83f0ada9-65b0-4860-b6ed-92bbdbe41d9c","resolution":{"observed_at":"2026-07-03T04:27:36.760518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-01T06:14:27.040572Z","title":"Limr: Less is more for rl scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22002","last_updated":"2026-07-24T06:04:04Z","snapshot_observed_at":"2026-08-06T07:11:53.312544Z","submitted_at":"2026-07-24T06:04:04Z","title":"Learning as Reasoning Unfolds: Progressive Rollout Allocation for Efficient Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T06:14:27.040572Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2607.22002"},"observation_digest":"sha256:02da1541d9c4fa778adb4b5ef18153bd2d2181d4cea834ba8b32257158dfd4ce","observation_id":"89a16f38-dd58-40f5-96c6-ac16c8f5eeeb","resolution":{"observed_at":"2026-08-01T06:14:27.040572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-01T00:28:59.453562Z","title":"Limr: Less is more for RL scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26253","last_updated":"2026-07-28T20:43:23Z","snapshot_observed_at":"2026-08-05T20:21:25.104474Z","submitted_at":"2026-07-28T20:43:23Z","title":"Early Verdicts, Better Budgets: Sequential Adaptive Rollout Allocation for Compute-Efficient RLVR","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T00:28:59.453562Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2607.26253"},"observation_digest":"sha256:33894b1841cebe6d59584f239b9e9fdd67e8c2c246a8054310a93795d8a99527","observation_id":"3843b153-84fa-4fee-90af-fe3a27f6222c","resolution":{"observed_at":"2026-08-01T00:28:59.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-07-31T01:31:11.009307Z","title":"arXiv preprint arXiv:2502.11886 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-05T16:42:19.744754Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:11.009307Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:fcc02b7fedda9da7ef7a18fa21fdadc1a85b32c6009ce6040db06b4911d2d7b5","observation_id":"fd9d861c-ef6a-4fd8-b5e1-be805572c6a1","resolution":{"observed_at":"2026-07-31T01:31:11.009307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11886","snapshot_observed_at":"2026-08-04T01:07:16.546910Z","title":"LIMR: Less is more for RL scaling.arXiv preprint arXiv:2502.11886,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00180","last_updated":"2026-08-04T02:59:21Z","snapshot_observed_at":"2026-08-07T23:09:41.591880Z","submitted_at":"2026-07-31T18:05:25Z","title":"A Constitution-Grid Instrument for Data-Efficient RL Alignment (C-Guard)","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T01:07:16.546910Z"},"links":{"cited_paper":"/paper/2502.11886","citing_paper":"/paper/2608.00180"},"observation_digest":"sha256:7b4a4ccbac61e8cafa245db5d6f1f7257826d28116f1e66297c8a1de4c57c38d","observation_id":"7ac8c575-74f0-4695-83a4-4668ce82174b","resolution":{"observed_at":"2026-08-04T01:07:16.546910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.11886/citation-record","integrity":"/paper/2502.11886/integrity","json":"/paper/2502.11886/citation-record.json","paper":"/paper/2502.11886"},"outbound":[],"paper":{"arxiv_id":"2502.11886","last_updated":"2025-02-17T15:13:29Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T18:20:45.496028Z","submitted_at":"2025-02-17T15:13:29Z","title":"LIMR: Less is More for RL Scaling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 42 inbound Pith citation observations for arXiv:2502.11886."}