{"as_of":"2026-08-15T14:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2e60acf4dc9b258e233037fcf761bf39089db79fae395163d42b9b7335f20f8","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:35:56.253150Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:26:22.158083Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.505929Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-08-12T16:45:40.094278Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:9aa5e782b9b940b26fc23bea82e0abca7046b4695c51de66900a452be42f3ea6","observation_id":"5011bd04-bd69-40bb-b9b5-63b1463ceb1d","resolution":{"observed_at":"2026-05-22T21:42:10.812398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-07T05:26:22.158083Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-15T01:56:53.551938Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.158083Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:05ac3a485bda248f6029f4cc087418374ddce113b5d2816d3a1d50083171fcb4","observation_id":"881d37f7-a003-4bc1-a8de-289095639b6c","resolution":{"observed_at":"2026-08-07T05:26:22.158083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2506.13351","last_updated":"2026-05-07T20:19:13Z","snapshot_observed_at":"2026-07-31T17:48:52.945760Z","submitted_at":"2025-06-16T10:43:38Z","title":"Direct Reasoning Optimization: Token-Level Reasoning Reflectivity Meets Rubric Gates for Unverifiable Tasks","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T09:48:56.990745Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2506.13351"},"observation_digest":"sha256:4ed835e5d82cfcfe28e116d22c51fa6e779a3cdc4df1af246512fef4cf812781","observation_id":"09f1d75b-3d1f-411a-81d3-dc06e696881d","resolution":{"observed_at":"2026-05-19T09:52:14.184491Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-06T14:51:25.447032Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.447032Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:3da23f8b2e5e3ce7ce8783cc0f1569157a66c2093bdaa9c4a9a646768709ca2d","observation_id":"d9cb06d2-5012-4061-985a-434b37d473ca","resolution":{"observed_at":"2026-08-06T14:51:25.447032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-05T00:06:08.567934Z","title":"Reinforcing general reasoning without verifiers.arXiv preprint arXiv:2505.21493, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06160","last_updated":"2025-09-07T18:07:58Z","snapshot_observed_at":"2026-08-08T05:58:57.881178Z","submitted_at":"2025-09-07T18:07:58Z","title":"Reverse-Engineered Reasoning for Open-Ended Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T00:06:08.567934Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.06160"},"observation_digest":"sha256:da6076d8fb5a71566820aa9e6c1d520a3789950d6576ac99db79c69138c42a6e","observation_id":"85b3a33d-241e-4e2f-ab1e-ef958c464377","resolution":{"observed_at":"2026-08-05T00:06:08.567934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-08-13T02:26:26.115035Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:7a98ebfa66cdd752a543646e9cf088811081aec966f1ba27fe5a528c52b16bf8","observation_id":"f8b2fe70-730b-4ddc-8020-c762a6a2adf3","resolution":{"observed_at":"2026-05-18T15:46:34.124175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-04T16:07:48.740176Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-14T21:41:31.710262Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":257,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:48.740176Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:97f103d9f898cda29a659c0e7dc366eb7740056dcc61e5523a04385fb1ad69d6","observation_id":"adc3cf64-8802-4479-ba29-f2d3a969ed65","resolution":{"observed_at":"2026-08-04T16:07:48.740176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2511.09907","last_updated":"2026-05-08T08:34:38Z","snapshot_observed_at":"2026-07-06T22:35:41.533403Z","submitted_at":"2025-11-13T03:08:51Z","title":"Learning to Pose Problems: Reasoning-Driven and Solver-Adaptive Data Synthesis","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T22:59:48.260121Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2511.09907"},"observation_digest":"sha256:dd0a6ee23de6b2aa3c5cefd8fcfc32d94f1697d2faf796ff65425ba98dbc79da","observation_id":"57b2310b-f1db-4c8c-8d96-305438cda973","resolution":{"observed_at":"2026-05-17T23:00:25.487127Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2602.12579","last_updated":"2026-05-22T13:13:23Z","snapshot_observed_at":"2026-08-13T11:25:08.429823Z","submitted_at":"2026-02-13T03:40:52Z","title":"VI-CuRL: Stabilizing Verifier-Independent RL Reasoning via Confidence-Guided Variance Reduction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T07:26:35.767179Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2602.12579"},"observation_digest":"sha256:17b04cacf64b507ef78270eacda0ab8928ef87184221d49ee081da0f3150f6e6","observation_id":"b607286b-d83d-43df-9474-bd80a6ef4580","resolution":{"observed_at":"2026-05-25T07:26:41.714012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-15T00:45:26.294340Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:df577a5c2a5f484f6e6116d6a15edc939d252379096aec2e3486f6e634d7faa0","observation_id":"52f3cb1b-099f-4c53-9e14-867cb07c84b5","resolution":{"observed_at":"2026-05-10T05:36:02.036290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:68152d899af49f4cd6041f60cdf42c3b9a1bbecf4962636cb6148c3687c34153","observation_id":"9c6b2e4e-3b78-4ece-bb46-3f61bff623b2","resolution":{"observed_at":"2026-05-10T23:15:49.560996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.09959","last_updated":"2026-05-11T04:12:34Z","snapshot_observed_at":"2026-08-11T16:16:11.008726Z","submitted_at":"2026-05-11T04:12:34Z","title":"G-Zero: Self-Play for Open-Ended Generation from Zero Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T03:39:40.780801Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.09959"},"observation_digest":"sha256:601154319ac7e30b67500eece5290d82259be9161a9f84b59e4b6f5649138cac","observation_id":"e01d6ce9-375f-44d7-b0c2-6248af681050","resolution":{"observed_at":"2026-05-12T07:11:24.522825Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2605.10810","last_updated":"2026-05-15T15:01:38Z","snapshot_observed_at":"2026-08-12T16:29:47.459756Z","submitted_at":"2026-05-11T16:32:06Z","title":"Likelihood scoring for continuations of mathematical text: a self-supervised benchmark with tests for shortcut vulnerabilities","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T17:20:39.969447Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2605.10810"},"observation_digest":"sha256:d510213a638fd21d02fd31d487b35971cd16a28d2931c916758bfa3c37028e12","observation_id":"8727f605-db0e-467b-8e17-1e63a94ffd2b","resolution":{"observed_at":"2026-05-19T17:22:41.894869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2606.00609","last_updated":"2026-05-30T08:18:40Z","snapshot_observed_at":"2026-08-12T22:34:53.432641Z","submitted_at":"2026-05-30T08:18:40Z","title":"CARE-RL: Capability-Aware Reinforcement Learning for Mitigating Cross-Domain Conflicts","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T19:01:14.340754Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2606.00609"},"observation_digest":"sha256:2cf5189d57993b10b48dc6a59d1eb67933eda28b421fc44d00df12feaaebead6","observation_id":"a24852dd-a7ee-4c3c-9469-f35df85cafb7","resolution":{"observed_at":"2026-06-28T19:02:33.978221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":"2505.21493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-01T20:56:13.505929Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":"2ec388db-b5cc-4baa-b30c-a65df5ea5bf7","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9b423ffabef2a1b8891b5740c15e6c659b44ff0efd9a2b3ff32bac90e55c4ee8","observation_id":"d86298e8-0466-4040-9e5a-1d394911d33f","resolution":{"observed_at":"2026-07-01T20:56:13.507223Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-07-14T08:49:37.615924Z","title":"Reinforcing general reasoning without verifiers.arXiv preprint arXiv:2505.21493, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10848","last_updated":"2026-07-12T17:20:44Z","snapshot_observed_at":"2026-08-14T14:47:04.903223Z","submitted_at":"2026-07-12T17:20:44Z","title":"Predictive Divergence Masks for LLM RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T08:49:37.615924Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2607.10848"},"observation_digest":"sha256:cfeb921237cb965b1d44f36e1657faa4382d1990b2cbf1f39198c90d9dd877a3","observation_id":"1c040be7-4644-4a71-ad7a-08c77ae88e6e","resolution":{"observed_at":"2026-07-14T08:49:37.615924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21493/citation-record","integrity":"/paper/2505.21493/integrity","json":"/paper/2505.21493/citation-record.json","paper":"/paper/2505.21493"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T13:35:49.676520Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.676520Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:5d4628d6217c9574f2e3e26ab2aa9e2c8a50cf9eb8ffebe9c11f8dc399d58c2f","observation_id":"a93d6290-e684-40aa-84ad-0648f6d7895e","resolution":{"observed_at":"2026-08-07T13:35:49.676520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.693470Z","title":null,"venue":null,"work_id":"8ed9980d-ca48-41d0-b56b-1deb6284bd9c","year":1996},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.783935Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:8c3fad9f14156caedc46d84495a1a79275cf05432932dd0b75148ce17ce43120","observation_id":"6b8912b9-44d6-4993-8c75-365c99efb6f4","resolution":{"observed_at":"2026-08-07T13:36:00.810288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.477862Z","title":"Bootstrapping language models with dpo implicit rewards","venue":null,"work_id":"28fc5ce4-1882-41c1-bbcc-49a0513cb09f","year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:49.895146Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:5c3dad413d0b3c81e845b697ee8f9fcb1be3c20c0b5ace6526f98e4dfe8e36cc","observation_id":"da40036f-4d63-460f-9951-a80959496b15","resolution":{"observed_at":"2026-08-07T13:36:00.555733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04282","last_updated":"2024-11-21T20:29:09Z","snapshot_observed_at":"2026-08-13T03:17:19.241729Z","submitted_at":"2024-11-06T22:02:30Z","title":"Language Models are Hidden Reasoners: Unlocking Latent Reasoning Capabilities via Self-Rewarding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04282","snapshot_observed_at":"2026-08-07T13:35:50.020849Z","title":"Language models are hidden reasoners: Unlocking latent reasoning capabilities via self-rewarding.arXiv preprint arXiv:2411.04282, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.020849Z"},"links":{"cited_paper":"/paper/2411.04282","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f29c2c9a3587590df4bd48e092163048a156783b9e9f92c51658f18cd7e87d02","observation_id":"52ebb6e6-cb33-47bf-9fd6-91affe7684c7","resolution":{"observed_at":"2026-08-07T13:35:50.020849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T13:35:50.157115Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.157115Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:785296093738912542c292c699f1f8137e05f831041944c818dc70bd875681a9","observation_id":"81e3becc-9596-4c67-8111-196dba531996","resolution":{"observed_at":"2026-08-07T13:35:50.157115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-07T13:35:50.307619Z","title":"Supergpqa: Scaling llm evaluation across 285 graduate disciplines.arXiv preprint arXiv:2502.14739, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.307619Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:5a615c4fc815cdc4d7957a1c0b829ed9a973576da8a9d5e9509a78984dacb523","observation_id":"2d669c5b-0d3a-4ba5-9a8e-f0cf67637d61","resolution":{"observed_at":"2026-08-07T13:35:50.307619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:50.451904Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.451904Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:ba7b98bcdfd570cd28edd7bc61bfb00f3d51f451f93bc4fadd4537a584e73efe","observation_id":"7a802705-31d5-4dfe-9f52-c59d5cddffa1","resolution":{"observed_at":"2026-08-07T13:35:50.451904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-12T22:32:04.019686Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T13:35:50.613928Z","title":"Rlef: Grounding code llms in execution feedback with reinforcement learning.arXiv preprint arXiv:2410.02089, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.613928Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a161b5a1fca5a3bb09916fadd59d2c43048f57f6ed711f2a9ba41443d1439123","observation_id":"41cd47ac-0822-4c76-8982-68592cfe2bbc","resolution":{"observed_at":"2026-08-07T13:35:50.613928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T13:35:50.694745Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.694745Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9ce38e29112fd83461526a81879344c1d35313b3bdc7252624f0558c3db7a495","observation_id":"5dade0db-61c1-4c40-8094-7951010b67e5","resolution":{"observed_at":"2026-08-07T13:35:50.694745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:35:50.841396Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.841396Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e4afc099073c99e914fad1fde85d8685873a941c551945a9584ec3bc22034b26","observation_id":"f51e8249-efdf-4f50-a80c-83e7ace68b80","resolution":{"observed_at":"2026-08-07T13:35:50.841396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:50.986072Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:50.986072Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d2dae98a102f1fb969fb7159d73041e56800c2e68a49830cc6d75d6830fc4915","observation_id":"532f803e-3d01-46a4-aeea-6d6fa3efeaf9","resolution":{"observed_at":"2026-08-07T13:35:50.986072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:35:51.098076Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.098076Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:86873e24d99ec658f366bdbab6f816478d426ae60cc25dfb3d03a62d8556100e","observation_id":"8ab29f53-b30b-494d-88ee-a43a1f872e9f","resolution":{"observed_at":"2026-08-07T13:35:51.098076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.205483Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.205483Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e0e832028e963f0b271d3e5878e980cd571217f914695e8b8a22064f27073fab","observation_id":"3317d73c-bec0-4a93-9f00-2ebfaa75998e","resolution":{"observed_at":"2026-08-07T13:35:51.205483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T13:35:51.324740Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.324740Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:4a702f13e0048e2110bd7c472d96e56fe8aeba064d2ebaeecaf6460566bbc3ce","observation_id":"b2bbc0d8-6d7c-4e9a-8559-ef1948d36c91","resolution":{"observed_at":"2026-08-07T13:35:51.324740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-14T11:20:12.488890Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T13:35:51.425938Z","title":"Self-improvement in language models: The sharpening mechanism.arXiv preprint arXiv:2412.01951, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.425938Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d405d24d151290b9c2e4d996d476caf87ccfb069708dae4576edf08af55d632e","observation_id":"b479d45d-7c4b-4ae8-800e-17e7f52fb058","resolution":{"observed_at":"2026-08-07T13:35:51.425938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.526601Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.526601Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:7bb43c41671f196eb228009321aafee9c5acc4f30f84a93713edef7d325a19f6","observation_id":"81cf8b30-cfc3-4b32-a192-89c7731e1297","resolution":{"observed_at":"2026-08-07T13:35:51.526601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T13:35:51.600499Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.600499Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9a675524feb30b1419e6bbce02eed6e380825263be9f7b8dee7e8e2932097ce8","observation_id":"7d2439f9-9c29-4fb7-b7ca-c8cb2be5b697","resolution":{"observed_at":"2026-08-07T13:35:51.600499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.708819Z","title":"Solving quantitative reasoning problems with language models.Advances in Neural Information Processing Systems, 35:3843–3857, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.708819Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:26245706e51f1d4cf75c30923f75ec0f8a3890b8ee3fb4d348fc0f79f2ff7105","observation_id":"59922537-1b14-47ce-a2d4-346a1010e5b7","resolution":{"observed_at":"2026-08-07T13:35:51.708819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.819498Z","title":"Numinamath: The largest public dataset in ai4maths with 860k pairs of competition math problems and solutions.Hugging Face repository, 13:9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.819498Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:728a54e3af2c8b420dc78476e4713bed492c8d81d5d130d4e06f0cafbbe57ee6","observation_id":"cadd1958-83e1-4260-a2fe-7ebce56bb0ee","resolution":{"observed_at":"2026-08-07T13:35:51.819498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:51.952732Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:51.952732Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:3672cf25a86aa30862eac2858e45d99a1957fd9eac9623cbf391a35509b57e4e","observation_id":"fb322e58-6b54-4677-94c9-26d5f8f67426","resolution":{"observed_at":"2026-08-07T13:35:51.952732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03981","last_updated":"2025-05-06T21:08:27Z","snapshot_observed_at":"2026-08-07T15:49:23.234741Z","submitted_at":"2025-05-06T21:08:27Z","title":"X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03981","snapshot_observed_at":"2026-08-07T13:35:52.104790Z","title":"X-reasoner: Towards generalizable reasoning across modalities and domains, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.104790Z"},"links":{"cited_paper":"/paper/2505.03981","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:bc7fc3d6ce32685d71cd679959ccc534700b6a4bd4205e70bb7c3733400f942e","observation_id":"23d49f70-44e6-486d-8234-6972ef41ec39","resolution":{"observed_at":"2026-08-07T13:35:52.104790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:36:00.144588Z","title":"Oat: A research-friendly framework for llm online alignment.https://github.com/sail-sg/oat, 2024","venue":null,"work_id":"21dfbb55-c73f-4bdf-bb7f-7e38618b25f1","year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.211512Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:54dc7265674ed6a3826ffd306684166764c50c052aeec6dfe18a00ae82f5fc6a","observation_id":"8f616da6-ee5f-48fa-a183-eb4a4e5ecd88","resolution":{"observed_at":"2026-08-07T13:36:00.206502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.284816Z","title":"There may not be aha moment in r1-zero-like training — a pilot study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.284816Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:f0f016b8339b7532414c79f867a4f603e60558ca1abcffff4a3e2243b45e076b","observation_id":"99224617-7326-4c1a-85f0-2dd010ea96bc","resolution":{"observed_at":"2026-08-07T13:35:52.284816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T13:35:52.414743Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.414743Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9d2137a7be76d5a81ac0901c70c09c614a9b3c873c4f367e596f43827fb244a9","observation_id":"8fd9a995-3dc6-479b-9102-e66be0b39631","resolution":{"observed_at":"2026-08-07T13:35:52.414743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.527377Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.527377Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d040fc72e5b6221f8d5bb48b2924da5670ba803d1e82caf3b9e5340497c3b3df","observation_id":"00842862-6da4-4cb5-947f-450fb3d521b8","resolution":{"observed_at":"2026-08-07T13:35:52.527377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:52.600474Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.600474Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:8622fe26c65d19a761798b095ef31176625ecad1cc74d923e725f3811c67623c","observation_id":"f99e1cdc-3791-47c3-88d4-7fe27993c55d","resolution":{"observed_at":"2026-08-07T13:35:52.600474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14652","last_updated":"2025-06-09T17:40:25Z","snapshot_observed_at":"2026-08-12T18:09:06.281598Z","submitted_at":"2025-05-20T17:41:33Z","title":"General-Reasoner: Advancing LLM Reasoning Across All Domains","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14652","snapshot_observed_at":"2026-08-07T13:35:52.681204Z","title":"General- reasoner: Advancing llm reasoning across all domains.arXiv preprint arXiv:2505.14652, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.681204Z"},"links":{"cited_paper":"/paper/2505.14652","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6cfb0582ddcf97008e222e95db00c0b42d22ea8fd3cad38d10bc1692f63a6850","observation_id":"e8604899-443b-4c3e-8189-b8cef03b172b","resolution":{"observed_at":"2026-08-07T13:35:52.681204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.885512Z","title":"Ng, Daishi Harada, and Stuart J","venue":null,"work_id":"8d6e3c4b-b3cc-4002-9ac0-0c0004ac577e","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.844277Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:b20b320c85ecaefdc7006e2bfe04d8bb30e9c4f53bbc3379ea6e50d266db4162","observation_id":"a64d249a-1c61-4104-b764-d954622e262e","resolution":{"observed_at":"2026-08-07T13:35:59.955749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.339055Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":"070a88e1-68d2-43ad-a75f-19ff043d325f","year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.099446Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:b5024657b57a11e24d01a8288643a2ad9ee8192dc3c74a56d938d67a605238cb","observation_id":"4a747535-adc6-4e76-9340-bbe4f3af9954","resolution":{"observed_at":"2026-08-07T13:35:59.437638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.235958Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.235958Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6ee8b763c71006333a9b8728b2a065d11bbdef5d0c677b6f3cd305fb9f5c912b","observation_id":"fedd8f05-30b9-4aac-8644-585576047986","resolution":{"observed_at":"2026-08-07T13:35:53.235958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.355905Z","title":"Tinyzero","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.355905Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:2c66979bef454c2a7d4481c222783b309e88c468f47a70eeb53c7abe9df566d9","observation_id":"6de7d42f-7f10-4ba6-967c-3f7b9cc6ec85","resolution":{"observed_at":"2026-08-07T13:35:53.355905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.112592Z","title":"Training chain-of- thought via latent-variable inference.Advances in Neural Information Processing Systems, 36: 72819–72841, 2023","venue":null,"work_id":"41c4afaf-ed7d-4d5d-923e-3e05048f0e9f","year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.438954Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e394819b543cf8d002bd637cf2acc23f094ce2dcb3052f733d80d9dd899318da","observation_id":"a8008712-a0b1-452c-a993-0fa78b48d8e1","resolution":{"observed_at":"2026-08-07T13:35:59.181728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.528942Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.528942Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:68cbbd56494e6e2e12a2ac8f3cbe2fd77e8216f68ceea66564ca5a51e449794f","observation_id":"80afe6a7-a471-41af-9798-d8c60a771a76","resolution":{"observed_at":"2026-08-07T13:35:53.528942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.876116Z","title":"Learning to drive a bicycle using reinforcement learning and shaping","venue":null,"work_id":"966de1a7-fe9b-4a20-8405-7a1018c8a324","year":1998},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.652657Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:ac6cd4b8fb49f0e35bfcafae70be33906c2f82d5e37f2308de11bec3217b77eb","observation_id":"a1dd8e9e-70b0-4602-9844-d1cab760b508","resolution":{"observed_at":"2026-08-07T13:35:58.957200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:53.729825Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.729825Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a034367a1ca2ef3ea819fe2da91f0d2265a3f8f95499886447f4979c26ff362e","observation_id":"bff29ac9-4452-474e-a5a8-662cfbb18d31","resolution":{"observed_at":"2026-08-07T13:35:53.729825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:35:53.862659Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.862659Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:23ae5d02d6d3bac3de170c4c51d6d7d4646a78782a7782032b4d9dc0f07de702","observation_id":"ca43c1f2-a018-4109-b4ff-3389791b2fca","resolution":{"observed_at":"2026-08-07T13:35:53.862659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T13:35:53.962521Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:53.962521Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:26389e4f2ddb1d40dde2d49ab0d71045ebd0035513b17d5c8fc04d31bcca9661","observation_id":"a7849d0c-5308-4572-aae7-00b1eb99e966","resolution":{"observed_at":"2026-08-07T13:35:53.962521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-10T14:48:37.196526Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-07T13:35:54.067551Z","title":"Expanding rl with verifiable rewards across diverse domains.arXiv preprint arXiv:2503.23829, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.067551Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:61f0bc764a032ef4f34bfb0aac745acfb2a3c814ff09c37025b300b49279050b","observation_id":"facf22d4-454e-4613-b858-c10da0a74038","resolution":{"observed_at":"2026-08-07T13:35:54.067551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.172581Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.172581Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:d20b2e1030854525aa4f174001d71ce92380bc806977bc1bec61d4cd0674e3e8","observation_id":"13680724-420a-4471-9655-96475f45143a","resolution":{"observed_at":"2026-08-07T13:35:54.172581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19618","last_updated":"2025-05-28T14:42:09Z","snapshot_observed_at":"2026-08-12T17:02:54.282113Z","submitted_at":"2025-03-25T13:03:09Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning for Language Models to Unverifiable Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19618","snapshot_observed_at":"2026-08-07T13:35:54.275667Z","title":"Learning to chain-of-thought with jensen’s evidence lower bound.arXiv preprint arXiv:2503.19618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.275667Z"},"links":{"cited_paper":"/paper/2503.19618","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:97a8ecca757d75e00f1ff588a9453323355f39b278775d4ba42cb22bee8847f9","observation_id":"c5e30f52-8d0b-4008-a8f2-fc41b25e47ad","resolution":{"observed_at":"2026-08-07T13:35:54.275667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.354782Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.354782Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a97ef41d987bb8376ce04918a4e31d120090751e8619a38c7ddbee4c8393391d","observation_id":"23fbb93f-8030-4c13-9649-781b8f2dca25","resolution":{"observed_at":"2026-08-07T13:35:54.354782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:54.447387Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.447387Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:27d2fd1bfa5832105088cb2bd601a3b18470204d18105c2d99ed94b70c91b657","observation_id":"a661f906-bd43-41e7-96cd-89f67894319d","resolution":{"observed_at":"2026-08-07T13:35:54.447387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T13:35:54.550113Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.550113Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:e8d67cdcbf5419fc9cd82ecfdb38d37d7e498980c01f3c3bb545491870b7fd7e","observation_id":"8ae8c311-f20e-43d8-ad0d-9983c0c8b323","resolution":{"observed_at":"2026-08-07T13:35:54.550113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T13:35:54.659939Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.659939Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:46312b00ebbedd19c84f86a9f101fbe8279f5986e92a189a5f9d6f09b144ad77","observation_id":"6ab5a380-d554-4d25-a2ea-5ba8c30cf2dd","resolution":{"observed_at":"2026-08-07T13:35:54.659939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T13:35:54.837737Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.837737Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:7b9a9442444b8c5c608ee71d1e85881b59dfcfc23378fc74439e7796ba1ca388","observation_id":"dfbbdad7-3e5b-4f76-a2f8-96a7f26b2e10","resolution":{"observed_at":"2026-08-07T13:35:54.837737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.656544Z","title":"Self-rewarding language models.International Conference on Machine Learning,","venue":null,"work_id":"ca1f10af-42bf-47fa-810c-647fa0b82a95","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:54.952680Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:73b79377a3013e4523d24ef6a3caa7e4be92617413f47d0c8fb3be1af31f945f","observation_id":"0b46341a-8a36-4346-a992-69c3bac38ab0","resolution":{"observed_at":"2026-08-07T13:35:58.735265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.134741Z","title":"Naturalreasoning: Reasoning in the wild with 2.8 m challenging questions.arXiv preprint arXiv:2502.13124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.134741Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:75c94dc21a1e694d0a72efe6453f92dad101a1b59913b08a85f7a42cffee9387","observation_id":"ea9dad09-2bb7-4512-9ae8-730ae885cb81","resolution":{"observed_at":"2026-08-07T13:35:55.134741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-08-13T12:20:57.788212Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T13:35:55.254650Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.254650Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6823e14e1cb023051a23dd816dc2ab7ef8be15d5535ef78eb7c2d369afc8b6b4","observation_id":"eb9e4194-f947-421d-8802-662ec50072e4","resolution":{"observed_at":"2026-08-07T13:35:55.254650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:55.410399Z","title":"Mammoth2: Scaling instructions from the web.Advances in Neural Information Processing Systems, 37:90629–90660, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.410399Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:c5975af41fb327a7ccb1ecf4a1da6f8cb8c058e24ede0330cf1a80b3cfa5423d","observation_id":"9cb71e8a-757a-459b-a8f0-6bced49c0046","resolution":{"observed_at":"2026-08-07T13:35:55.410399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.558772Z","title":"7b model and 8k examples: Emerging reasoning with reinforcement learning is both effective and efficient.https://hkust-nlp.notion.site/simplerl-reason, 2025","venue":null,"work_id":"316ff338-f6f0-4699-848d-790ae87ae2b5","year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.503236Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:93ce8d15adee00c4527daf790a19c9ffe096f6ffebc62f991f2a7e7f254a0272","observation_id":"fd3fc11e-4ffb-4e99-b255-fabad4fbd632","resolution":{"observed_at":"2026-08-07T13:35:58.609689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-15T10:46:42.452851Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T13:35:55.613828Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.613828Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:7e2856b34c4e85e6942816525eebca1760f7add006722a04e9009ca09f33bec9","observation_id":"db5b202b-4c9f-4cf3-8395-4e90c75576e0","resolution":{"observed_at":"2026-08-07T13:35:55.613828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-08-15T13:55:17.887932Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T13:35:55.747382Z","title":"standard candles","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.747382Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:4915f8b1b793eb075b993dcf3aec9d25aaa3406319b04e3451e8cc1517827770","observation_id":"ec4bb7de-61fa-4edc-990c-b6107dad8896","resolution":{"observed_at":"2026-08-07T13:35:55.747382Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.238397Z","title":null,"venue":null,"work_id":"71382ebf-45f3-4bdd-afcf-42732d4f404c","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.845493Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:b2a4e2424f91b7f6d63a43f1c60dde53bacb4c14999faadf5015030f9c0797d4","observation_id":"acce323f-2ddd-4261-a551-78492765c929","resolution":{"observed_at":"2026-08-07T13:35:58.331998Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:58.063973Z","title":"This relation is usually given in a form where a graph or a formula relates period to absolute magnitude (a measure of intrinsic brightness)","venue":null,"work_id":"d6c181a8-3de9-4469-9823-ebf72e27f8d4","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.913862Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:1a490c6cd869e928ad054102de80a0c383073b78b817091ea8d8584f99994100","observation_id":"e6763064-39f5-48b3-b01b-87fda9d95806","resolution":{"observed_at":"2026-08-07T13:35:58.140035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.797835Z","title":null,"venue":null,"work_id":"394a22e7-76f2-4cbe-81ef-070e9a86bbc5","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.981091Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:6d449e504ca0eb7c8cb560ca984e64b32b472fb2feec078e0cff036f38fcdcb5","observation_id":"120c5616-51b9-4211-9664-27fd8f35cbdc","resolution":{"observed_at":"2026-08-07T13:35:57.928563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.630169Z","title":"\"\"everyone else is doing it","venue":null,"work_id":"f71c1a4f-d0d0-4737-979e-7090b4f4ac8f","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.073560Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:a337f0582ab0377ea26d98713329f3e52c487774eca7821e9d1e89910643c9cd","observation_id":"0edea18e-4c38-4d9f-974d-6f07835b4b5f","resolution":{"observed_at":"2026-08-07T13:35:57.686510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.344803Z","title":"Their reasoning is fear-based, and they view rules as set by authority figures","venue":null,"work_id":"2fbc264e-3e69-433b-9471-805824e8a4d8","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.170121Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9f4b02de05989a353ffe2c361991786256b9cc197219d71ad5d4569ae04ced39","observation_id":"ecf44972-dfd3-463b-97e4-8ff3ab1de69d","resolution":{"observed_at":"2026-08-07T13:35:57.494309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:57.067024Z","title":"what’s in it for me?","venue":null,"work_id":"d9b9174d-0639-4b30-a6af-4604c16ab48c","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:56.253150Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9b8248e6c02562fcbbbb2d18157b36358ea06a8935b4d4dc4106a749da0cb45d","observation_id":"ef0107df-7832-4415-b647-576f0b7fd712","resolution":{"observed_at":"2026-08-07T13:35:57.168558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:35:59.593662Z","title":null,"venue":null,"work_id":"46b7b514-57d9-4ac1-bc63-22e77da413c0","year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:52.950970Z"},"links":{"citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:9236e8cdc8a97893a92fca046602b904110221e75bb2681af9a00805ba588c25","observation_id":"0e3fc1d9-feba-4c02-b9d5-adcd9d901f15","resolution":{"observed_at":"2026-08-07T13:35:59.715432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-07T13:35:55.039840Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:35:55.039840Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2505.21493"},"observation_digest":"sha256:18f3f35dda80f73f788a555263ed3180964aa398a79b927f66602b21f0ec78af","observation_id":"2c3364b5-f502-45b4-9dda-64bae6f72e75","resolution":{"observed_at":"2026-08-07T13:35:55.039840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 16 inbound Pith citation observations for arXiv:2505.21493."}