{"as_of":"2026-08-11T09:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3f92ea76d56a4f52f70156baea4bbfacfa4301de4c54dd40d279625b6d2ace3","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:45:41.982954Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T14:49:39.188220Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:09:29.035824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2512.15146","last_updated":"2026-05-06T13:57:35Z","snapshot_observed_at":"2026-08-09T00:40:24.586117Z","submitted_at":"2025-12-17T07:21:54Z","title":"Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T21:53:30.911773Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2512.15146"},"observation_digest":"sha256:beab0af748a16201c8abe9155f128aa893cb16f72be267c42c6f167f33542c7b","observation_id":"c7f55504-31e6-49ef-94f0-d257b98496ea","resolution":{"observed_at":"2026-05-16T21:53:35.117871Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2605.09188","last_updated":"2026-05-09T22:05:59Z","snapshot_observed_at":"2026-08-11T00:30:42.674771Z","submitted_at":"2026-05-09T22:05:59Z","title":"DARE: Difficulty-Adaptive Reinforcement Learning with Co-Evolved Difficulty Estimation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-12T03:12:49.428954Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2605.09188"},"observation_digest":"sha256:278788227d52215509f2c9bb18702b9385cb939b65c42c7920058a7f9bbf3558","observation_id":"0017b414-69ab-4557-ba87-51182b5626e4","resolution":{"observed_at":"2026-05-12T03:16:19.312129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2605.28247","last_updated":"2026-05-27T09:58:05Z","snapshot_observed_at":"2026-07-06T23:37:50.157617Z","submitted_at":"2026-05-27T09:58:05Z","title":"IRDS: Interpretable RLVR Data Selection via Verifier-Coupled Sparse Autoencoder Coverage","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T14:49:39.188220Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2605.28247"},"observation_digest":"sha256:cc0a184e223229dd85404ae2abd0374c0a38865eaa01749fb3cc2cf88c2f2e72","observation_id":"3a17c0a3-cb51-4d50-becd-eea6adcefb54","resolution":{"observed_at":"2026-06-29T14:53:31.190838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-02T00:43:38.678130Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:bb1b9bad4e1cd95c7e23f12801f8f3ae8eb0849b9ca9194551f7b28e70999d92","observation_id":"30d0e72f-8d3b-44f4-9bf3-76c60791f499","resolution":{"observed_at":"2026-07-01T21:16:13.366003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.04503","last_updated":"2026-06-03T06:34:42Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:34:42Z","title":"Smart Picks in the Dark: Towards Efficient RLVR for Reasoning via Tracing Metacognitive Pivots","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T06:55:09.927034Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.04503"},"observation_digest":"sha256:a337fcb1f9c4796132ee821eaee2066a96e52df825f443a74794d13ab9ed7a23","observation_id":"0d6c5df4-001e-4297-abea-637ad4718b16","resolution":{"observed_at":"2026-07-02T07:26:46.260794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.09380","last_updated":"2026-06-08T11:57:17Z","snapshot_observed_at":"2026-08-02T13:37:53.223013Z","submitted_at":"2026-06-08T11:57:17Z","title":"Reasoning Arena: Trace Tournaments When Verifiable Rewards Fall Short","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T17:18:03.459289Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.09380"},"observation_digest":"sha256:51c2dd6e44c801382e993f5d8bb4f896baab6fc39ba6a42b423c87ef6d4df3c0","observation_id":"642a7c29-2225-48ce-a3f3-600d24e1f83a","resolution":{"observed_at":"2026-07-03T00:17:29.544665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"cited_work":{"arxiv_id":"2509.01321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01321","snapshot_observed_at":"2026-07-04T03:09:29.035824Z","title":"Xinyu Tang, Zhenduo Zhang, Yurou Liu, Wayne Xin Zhao, Zujie Wen, Zhiqiang Zhang, and Jun Zhou","venue":null,"work_id":"687491fe-063b-4cea-98ea-1c89ac8ab1b9","year":2026},"citing_paper":{"arxiv_id":"2606.19750","last_updated":"2026-06-18T03:31:19Z","snapshot_observed_at":"2026-07-06T23:55:01.487552Z","submitted_at":"2026-06-18T03:31:19Z","title":"Manifold Bandits: Bayesian Curriculum Learning over the Latent Geometry of Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T18:29:47.613424Z"},"links":{"cited_paper":"/paper/2509.01321","citing_paper":"/paper/2606.19750"},"observation_digest":"sha256:74296f3342d459be098fbbc9d54f591ded5446c7a9ba877ec3135df818f8e8f7","observation_id":"c639ed77-de36-4ef0-ae45-59cbff164918","resolution":{"observed_at":"2026-07-04T03:09:29.037593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.01321/citation-record","integrity":"/paper/2509.01321/integrity","json":"/paper/2509.01321/citation-record.json","paper":"/paper/2509.01321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.195171Z","title":"This objective aims to select a subset Y that is both diverse (as captured by det(SY)) and influential (as promoted by the product of weights ∏i∈Y wi)","venue":null,"work_id":"3d2fa4e8-73e5-4dc1-a03a-debb78887885","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.966040Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:07fd76acef0ecabfb0f9926bce608b3f40e37d9c8705b3f5e795d6476dadbd0b","observation_id":"88bfa3fa-7790-4cb2-a1f6-177f484a5ec9","resolution":{"observed_at":"2026-08-05T12:45:42.198696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T12:45:41.919862Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.919862Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:5e74ba527732890b148aae603510b2e7614a30b59bd67da9105ead44a107b7a0","observation_id":"5a34c283-42b9-4ecd-8940-9542f172ac93","resolution":{"observed_at":"2026-08-05T12:45:41.919862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1207.6083","last_updated":"2013-01-10T20:43:53Z","snapshot_observed_at":"2026-07-06T02:52:34.943660Z","submitted_at":"2012-07-25T18:45:43Z","title":"Determinantal point processes for machine learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1207.6083","snapshot_observed_at":"2026-08-05T12:45:41.926767Z","title":"Determinantal point processes for machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.926767Z"},"links":{"cited_paper":"/paper/1207.6083","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:d169c11c1ce98717cd3790af38e584b0e4bb379b6b6b6db1d5ef5393dbdb4f47","observation_id":"c075a77f-a5b2-4ff2-bfd0-c722d676654b","resolution":{"observed_at":"2026-08-05T12:45:41.926767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-10T12:02:35.919497Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T12:45:41.937712Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.937712Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:1be0ea008fa5dc0d6ab1ec8831c7f346fedcc90b814db39648a5aaadade36a79","observation_id":"c9397d96-dbf1-4a87-929b-45ee2b2021b6","resolution":{"observed_at":"2026-08-05T12:45:41.937712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-11T01:31:26.242281Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-05T12:45:41.944746Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.944746Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:afa6f7cddeab991c028f494725d5a2120abca431045787a679b8d28b5272fff3","observation_id":"0bd7a51a-db29-4631-b72a-09e361584711","resolution":{"observed_at":"2026-08-05T12:45:41.944746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T12:45:41.948669Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for LLM reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.948669Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:671b729d0d4036f212ad6c217273aa6d3ea796418eeb3a9eaec565ae47eba14f","observation_id":"d1159417-894d-428f-a0b1-3afcd9f06bff","resolution":{"observed_at":"2026-08-05T12:45:41.948669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T12:45:41.952290Z","title":"DAPO: an open-source LLM reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.952290Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:78b7bf32bdf7bd2f30802fcf26e55a1e5e02441d5b003ece267797f535cbeaf9","observation_id":"a9dcc236-a80b-4850-bcbb-1a067acc5307","resolution":{"observed_at":"2026-08-05T12:45:41.952290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08819","last_updated":"2024-12-11T23:31:06Z","snapshot_observed_at":"2026-08-06T01:09:31.956094Z","submitted_at":"2024-12-11T23:31:06Z","title":"HARP: A challenging human-annotated math reasoning benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08819","snapshot_observed_at":"2026-08-05T12:45:41.956023Z","title":"Yue, Lovish Madaan, Ted Moskovitz, DJ Strouse, and Aaditya K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.956023Z"},"links":{"cited_paper":"/paper/2412.08819","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:c0fce67f38f42cbf1c17b52b2d6d19660686ff43d388441859286ca9c5acb776","observation_id":"43746aa5-ec9c-4df8-8e5c-4f0de72a7011","resolution":{"observed_at":"2026-08-05T12:45:41.956023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-10T18:23:47.368788Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T12:45:41.959563Z","title":"V APO: efficient and reliable reinforcement learning for advanced reasoning tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.959563Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:0de7f14a82eb780ec853b1c92b4c66b68375fd26fd01dcaeb60570458c5b4a1a","observation_id":"bcf8172e-f661-4089-b7e5-131ca1103dfb","resolution":{"observed_at":"2026-08-05T12:45:41.959563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T12:45:41.962651Z","title":"A survey of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.962651Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:843e7aaba728bc2decac2b5001ed1c37c6c13d8c8a8bb684e8335854c3c39bb5","observation_id":"5e0a894f-8988-445e-8468-2d97eeda04ba","resolution":{"observed_at":"2026-08-05T12:45:41.962651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.184654Z","title":"We train DeepSeek-R1-Distill-Qwen-7B and DeepSeek-R1-Distill-Llama-8B on 64×H200 GPUs, and Qwen2.5-Math-7B on 32×H200 GPUs","venue":null,"work_id":"393f21e2-7726-4e38-8a34-ba0220586614","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.969785Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:c3f29c2403314993b75abaadf4aab6bb1e951dd7f9f29c1f17e613f678972a5b","observation_id":"48f3f476-4dc4-4040-9d57-7bfa4cf05fbe","resolution":{"observed_at":"2026-08-05T12:45:42.188191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.155416Z","title":"We follow Zheng et al","venue":null,"work_id":"28197969-edbe-436c-bea4-d4008faf78ed","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.979652Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:22cc88f8b02435ea90d6ea537d759dc9c9f1bbbbb4660b1fe07f2c84cd00473e","observation_id":"6e6c5ecd-519d-4fa9-952d-eb28c627c9b0","resolution":{"observed_at":"2026-08-05T12:45:42.158494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.143088Z","title":"• Random: Randomly samples data from the training set","venue":null,"work_id":"6851933c-c626-41b2-910c-5a9b365c5582","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.982954Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:e7b5e072b8466190bfd64eeae99249369a676929d0cb50ba4844744e09a693b7","observation_id":"c3b2bdac-a2c9-44be-987f-c4d4608ca16d","resolution":{"observed_at":"2026-08-05T12:45:42.148614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.174819Z","title":"Similar to Yue et al","venue":null,"work_id":"4042df5c-089c-493e-82d1-886787b95a49","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":256,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.973389Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:4c7f5928d18b5bb503dc67266f93ac60e8dd593f8d0f362a24d7f425b44ad758","observation_id":"ceba9f09-7548-451a-a022-897a36409df8","resolution":{"observed_at":"2026-08-05T12:45:42.178162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-05T12:45:41.916058Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.916058Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:982c9c695240156892936190bcb39a421aacf02fafb9c457c78fb9534c4a872c","observation_id":"c3b6a25e-7df7-48b1-9668-7093fca649c4","resolution":{"observed_at":"2026-08-05T12:45:41.916058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.165079Z","title":"User: \\n [question] \\n Please reason step by step, and put your final answer within \\boxed{}. \\n \\n Assistant:","venue":null,"work_id":"65adec8c-47b6-4ac3-baa2-9fb41950c07d","year":2021},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.976582Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:a62b9b0813df0655c74761c50578de9c87b3f7e879561027d661c2432f1bee4d","observation_id":"05558ae2-4940-4aa7-8ec2-355ffabdf59b","resolution":{"observed_at":"2026-08-05T12:45:42.168425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T12:45:41.923179Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.923179Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:f66ea3a2542694035867fde73c5e83b730989c7115201112de7fa9bc453fc2ea","observation_id":"5bda1edf-bfb7-4388-b30d-6e23b180f3e0","resolution":{"observed_at":"2026-08-05T12:45:41.923179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11480","last_updated":"2026-04-25T08:46:54Z","snapshot_observed_at":"2026-08-07T21:28:45.095079Z","submitted_at":"2025-06-13T06:05:58Z","title":"LearnAlign: Data Selection for LLM Reinforcement Learning with Improved Gradient Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11480","snapshot_observed_at":"2026-08-05T12:45:41.930273Z","title":"Learnalign: Reasoning data selection for reinforcement learning in large language models based on improved gradient alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.930273Z"},"links":{"cited_paper":"/paper/2506.11480","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:ec310d296f823fa26df5f7fb22d7ef565c4d3a57b1b0c17efa43f996e245fa85","observation_id":"2940da6b-fcee-47ff-9612-fdcb03b71617","resolution":{"observed_at":"2026-08-05T12:45:41.930273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T12:45:41.941078Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.941078Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:e592a76ae7947b6609bd90fb9fb6f50867f93571f682e47359cce70b8f0ce6c9","observation_id":"6deb6c8d-754b-4b7d-ab59-6d44bd4c19f8","resolution":{"observed_at":"2026-08-05T12:45:41.941078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T12:45:41.933948Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.933948Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:2166cd8a564fa8df4fa7e2a1e0cf3bad49186f38db6e1779ffcdc57f71f01394","observation_id":"b113e1de-a27c-4a7e-9a9b-8bb9bd634cc6","resolution":{"observed_at":"2026-08-05T12:45:41.933948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T12:45:42.204985Z","title":"Zachary Ankner, Cody Blakeney, Kartik Sreenivasan, Max Marion, Matthew L","venue":null,"work_id":"300b967e-93d1-4e14-a9a9-da4875bbbb2e","year":2025},"citing_paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T12:45:41.912268Z"},"links":{"citing_paper":"/paper/2509.01321"},"observation_digest":"sha256:073299e70e910291e89317e2c4192d91dea61638605032c40e5a727cf76ee43c","observation_id":"fa6945b6-7936-49d9-b632-7454cdcb75f3","resolution":{"observed_at":"2026-08-05T12:45:42.208226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.01321","last_updated":"2025-09-01T10:04:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T00:34:48.982634Z","submitted_at":"2025-09-01T10:04:20Z","title":"Towards High Data Efficiency in Reinforcement Learning with Verifiable Reward"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 7 inbound Pith citation observations for arXiv:2509.01321."}