{"as_of":"2026-08-19T17:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3daac2b92ec8a3b07cf9e6f09469744b55e7b22e2fb42ec7f6ada482d0943812","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:37:51.086217Z","state":"measured"},{"denominator":94,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":94,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":73,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:52:15.381183Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2505.14412","last_updated":"2026-04-19T14:17:44Z","snapshot_observed_at":"2026-08-13T23:46:40.292415Z","submitted_at":"2025-05-20T14:26:19Z","title":"PRL: Prompts from Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T14:25:22.002977Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2505.14412"},"observation_digest":"sha256:d7a0686c94cbafb975ad13e77bc8b64f6aa7b9afb90897568871c39cbcacb8fa","observation_id":"41dbb91b-0dd0-4c7b-b90f-4ef002dcd815","resolution":{"observed_at":"2026-05-22T14:26:40.402303Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-07T13:07:49.797135Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:49.797135Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2505.22660"},"observation_digest":"sha256:2e27529efc3acfd45b556b3d8de73a32fdf168eeed5f7e72ba88f37abd49539d","observation_id":"f1032a4a-c066-4bc0-bcab-e6fa66a95644","resolution":{"observed_at":"2026-08-07T13:07:49.797135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:52:05.462042Z","title":"Zettlemoyer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:52:05.462042Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2506.20512"},"observation_digest":"sha256:d10f42911272a89649a4f3948d060b0245a8ca969ee63dc6759467a2ff88fb9e","observation_id":"4c0b8fcf-9b99-4446-8d7e-3af410306ce9","resolution":{"observed_at":"2026-08-06T22:52:05.462042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T22:45:02.881915Z","title":", Li, S S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00054","last_updated":"2025-06-25T20:07:47Z","snapshot_observed_at":"2026-08-16T00:49:04.578925Z","submitted_at":"2025-06-25T20:07:47Z","title":"Enhancing Reasoning Capabilities in SLMs with Reward Guided Dataset Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T22:45:02.881915Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00054"},"observation_digest":"sha256:b55cf3c8df013e99254d899afa4e09cfb0e7775de934c16e9dc8b1e0a710ce47","observation_id":"870979c2-4e34-441d-8bad-e60b4bcbc6c5","resolution":{"observed_at":"2026-08-06T22:45:02.881915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:21:41.942088Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-14T02:32:06.313774Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.942088Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:75fb4fbe8eefe30649f9ad03c45fa7bf214eb9c223a2988c856cb2bb1073af06","observation_id":"4cef041f-37dd-4886-a7f6-26e174124b9c","resolution":{"observed_at":"2026-08-06T21:21:41.942088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T21:13:15.096866Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00726","last_updated":"2025-08-27T22:56:13Z","snapshot_observed_at":"2026-08-19T09:27:49.123263Z","submitted_at":"2025-07-01T13:16:34Z","title":"Can Large Language Models Develop Strategic Reasoning? Post-training Insights from Learning Chess","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:15.096866Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.00726"},"observation_digest":"sha256:af9129fe01cd24c38158a42b102575ae6e509cba409557b79e429cbab5436c0d","observation_id":"bf7edc7d-f230-4347-9a5c-06a11217689c","resolution":{"observed_at":"2026-08-06T21:13:15.096866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:c611d42327e6c63c27990316b6b8998a0791ae56d6b8f1b0b479679e41b95c8b","observation_id":"349ccc8e-5008-48bf-8d04-fdc34e30e3e7","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T17:17:06.284535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11408","last_updated":"2026-01-19T08:53:46Z","snapshot_observed_at":"2026-08-08T03:58:22.874456Z","submitted_at":"2025-07-15T15:28:37Z","title":"KisMATH: Do LLMs Have Knowledge of Implicit Structures in Mathematical Reasoning?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:17:06.284535Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.11408"},"observation_digest":"sha256:e8a4399c0ec2a2573e6e625815d368b8d58c51c980a0f46be02773e92dc63259","observation_id":"9ebc9ced-6798-441c-9ce9-e5b486c46400","resolution":{"observed_at":"2026-08-06T17:17:06.284535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T16:34:25.176219Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-15T15:23:09.345799Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.176219Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:eb749bc542c6d190523aa8ed99794649dfa146cc772be9e770fb6753afef2b01","observation_id":"c615db8a-b98d-4bb0-aa2a-419d1f96996b","resolution":{"observed_at":"2026-08-06T16:34:25.176219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-06T15:29:13.444701Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-12T12:54:07.864402Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:13.444701Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:7bdbf76d2d86f9e6f78aefd4c13abbbf29f024f941840388e460b2e9cc3c1392","observation_id":"24d1b1ce-3df5-47ed-81f1-c779200c85d5","resolution":{"observed_at":"2026-08-06T15:29:13.444701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-15T17:52:15.381183Z","title":"S.; Xin, R.; Geng, S.; Wang, Y.; Oh, S.; Du, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20252","last_updated":"2025-08-12T11:22:33Z","snapshot_observed_at":"2026-08-15T20:15:19.196311Z","submitted_at":"2025-07-27T12:47:26Z","title":"Post-Completion Learning for Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:52:15.381183Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2507.20252"},"observation_digest":"sha256:935a4350229bbcbb0f728b82de91037431aca76d3d7c80a832a79d241fe1e44d","observation_id":"ae3c49ea-7b7a-47b2-9344-b4211a087cd4","resolution":{"observed_at":"2026-08-15T17:52:15.381183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T23:10:24.501625Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.05928","last_updated":"2025-08-08T01:24:06Z","snapshot_observed_at":"2026-08-13T20:01:20.217289Z","submitted_at":"2025-08-08T01:24:06Z","title":"Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:24.501625Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.05928"},"observation_digest":"sha256:c5ec4bd133272de0920c03452f3f762e7d6af2c484f9f34b7c6e3812913acde2","observation_id":"e6e576f3-303d-4653-9fa9-de1668690b16","resolution":{"observed_at":"2026-08-05T23:10:24.501625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T21:12:11.863783Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.09303","last_updated":"2025-08-12T19:38:21Z","snapshot_observed_at":"2026-08-17T16:05:12.565619Z","submitted_at":"2025-08-12T19:38:21Z","title":"ParallelSearch: Train your LLMs to Decompose Query and Search Sub-queries in Parallel with Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T21:12:11.863783Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.09303"},"observation_digest":"sha256:24bb442e77b555b5ca8037fb3d996f6decfa4429dfb5b1202eaa589e9731723f","observation_id":"2adda67e-b61d-4bfa-a97b-07329c450e82","resolution":{"observed_at":"2026-08-05T21:12:11.863783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:21:08.167577Z","title":"Spurious rewards: Rethinking training signals in RLVR.CoRR, abs/2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-18T20:12:03.334534Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.167577Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:d99f56ffce36d502423f41e13fa30779914ca952e18ab7a78b0e108fcf20da25","observation_id":"06d7b561-f235-48b0-80e6-e4599b64f9c2","resolution":{"observed_at":"2026-08-05T20:21:08.167577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T20:04:02.795840Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11356","last_updated":"2025-08-29T08:04:20Z","snapshot_observed_at":"2026-08-13T03:10:11.449132Z","submitted_at":"2025-08-15T09:49:14Z","title":"ETTRL: Balancing Exploration and Exploitation in LLM Test-Time Reinforcement Learning Via Entropy Mechanism","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:02.795840Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.11356"},"observation_digest":"sha256:13760370a04ce11b884d06fd423ac1b329e9f327d84f58cebc5590b25f8f443b","observation_id":"936e5643-2132-4e42-b7ff-7ab06ed3bc6b","resolution":{"observed_at":"2026-08-05T20:04:02.795840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-08-15T16:01:07.680571Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:fb0cc872bc880484ae392ddaf320dd1d07894e471d649ed83337dd80a64c660c","observation_id":"e84b70b4-5be6-47c1-8bf3-377ccab63756","resolution":{"observed_at":"2026-05-18T21:06:50.837840Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T10:31:37.869115Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-18T16:28:53.247978Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.869115Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:b21ff601ffcadb6209f58c1961917d291472236b93bb2e46111586cfa0e2b6ca","observation_id":"70d53b55-92e9-418f-8b2e-2d0617b2bff0","resolution":{"observed_at":"2026-08-05T10:31:37.869115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2509.18052","last_updated":"2026-04-06T17:12:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T17:27:29Z","title":"The PIMMUR Principles: Ensuring Validity in Collective Behavior of LLM Societies","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T14:31:11.974395Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2509.18052"},"observation_digest":"sha256:ec05ed44542db91fdd05cb51658627d02d64c42f8ea0a3ea012ac16fe67f1c68","observation_id":"37a43eb2-b4c8-43e4-a591-5430be5eb915","resolution":{"observed_at":"2026-05-18T14:31:29.537032Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T12:59:01.622788Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.01427","last_updated":"2026-07-30T00:32:01Z","snapshot_observed_at":"2026-08-15T14:39:50.091427Z","submitted_at":"2025-10-01T20:06:48Z","title":"A Tale of LLMs and Induced Small Proxies: Scalable Small Language Models for Knowledge Mining","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T12:59:01.622788Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.01427"},"observation_digest":"sha256:715fbe2f85c9e8177f6054d0af889c933781074f1887399474e0d09e20a5877e","observation_id":"d69aa6bd-aea1-46e4-914e-affbf4746d30","resolution":{"observed_at":"2026-08-04T12:59:01.622788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T11:23:20.230179Z","title":"Spurious rewards: Rethink- ing training signals in rlvr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.05478","last_updated":"2026-06-08T05:16:04Z","snapshot_observed_at":"2026-08-17T22:31:14.618678Z","submitted_at":"2025-10-07T00:39:14Z","title":"AQA-TTRL: Self-Adaptation in Audio Question Answering with Test-Time Reinforcement Learning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:23:20.230179Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.05478"},"observation_digest":"sha256:2e691a008e61da6e9182088ef34702d50a84614635e206f40de4f410c2a93a71","observation_id":"c28a2971-a4d6-4140-b04f-4f1f68ed129d","resolution":{"observed_at":"2026-08-04T11:23:20.230179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T10:44:31.017232Z","title":"Spurious rewards: Rethinking training signals in rlvr","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-16T06:07:54.370427Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:31.017232Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:c2fd1f481caf7326c2793477db2e26e3fe25e81c23d153bf679ff7dd88737036","observation_id":"cdfd8145-d278-4c87-bc4a-31f25d7eed51","resolution":{"observed_at":"2026-08-04T10:44:31.017232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-15T04:40:53.565526Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:11:29.205366Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:fc262d68dd3c6256c0ebd1db985f477938cc416d7c3248f84a498b4cc6c71432","observation_id":"74485d24-0a0e-45a5-88f1-77a2265e499a","resolution":{"observed_at":"2026-05-18T05:12:23.642649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-15T04:40:53.565526Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T20:06:16.172916Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:f6860c14909dd305c8eba3e2598f0f05341481114f050de8536e5b7f70c28423","observation_id":"335e52f9-56cd-4d6e-b4f0-1f8cd628784a","resolution":{"observed_at":"2026-05-21T20:10:34.994167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T08:53:07.162212Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.18814","last_updated":"2026-07-05T03:44:20Z","snapshot_observed_at":"2026-08-15T04:40:53.565526Z","submitted_at":"2025-10-21T17:15:56Z","title":"A Model Can Help Itself: Reward-Free Self-Training for LLM Reasoning","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T08:53:07.162212Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2510.18814"},"observation_digest":"sha256:feb9a3a119f962ea0ba920f7a7d2218b8538e95afc806025abf73e15cf7e2826","observation_id":"1d569e59-5604-43f3-ab7f-8d9ffc7f311f","resolution":{"observed_at":"2026-08-04T08:53:07.162212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2511.14045","last_updated":"2026-05-09T12:37:58Z","snapshot_observed_at":"2026-08-11T14:19:04.295776Z","submitted_at":"2025-11-18T01:51:34Z","title":"Auditing Data Membership in Reinforcement Learning With Verifiable Rewards","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-17T21:37:54.702010Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2511.14045"},"observation_digest":"sha256:a1635a5faec53435208f68c8d88c5405cca1f51c74ef5ef070d97959ecf7d075","observation_id":"cd0c33e4-7ff5-4b20-b972-aed121ca57f9","resolution":{"observed_at":"2026-05-17T21:40:17.700706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2511.23473","last_updated":"2025-11-28T18:58:14Z","snapshot_observed_at":"2026-08-04T17:31:45.294646Z","submitted_at":"2025-11-28T18:58:14Z","title":"ThetaEvolve: Test-time Learning on Open Problems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:16:27.293449Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2511.23473"},"observation_digest":"sha256:b939718362fcd7739d616053e15f8ff477527cc8a7dea9c9b44fbb0a46db899b","observation_id":"1b0b2d8a-1d75-447c-9764-7a64e8d2eed6","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2512.00778","last_updated":"2026-05-15T09:26:17Z","snapshot_observed_at":"2026-08-15T17:01:04.268451Z","submitted_at":"2025-11-30T08:27:59Z","title":"What Is Preference Optimization Doing, and Why?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T18:37:48.161545Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2512.00778"},"observation_digest":"sha256:a08df960fcb9dbf0c73bdbd3b82582504b9eb6be298e409c7d38b991c84ffe76","observation_id":"5ec94834-9f43-4502-8714-d84f68b76924","resolution":{"observed_at":"2026-05-21T18:40:28.955681Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-03T10:13:15.212310Z","title":"S., Xin, R., Geng, S., Wang, Y ., Oh, S., Du, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.11061","last_updated":"2026-06-24T20:10:42Z","snapshot_observed_at":"2026-08-18T03:58:22.501788Z","submitted_at":"2026-01-16T07:55:38Z","title":"Spurious Rewards Paradox: Mechanistically Understanding How RLVR Activates Memorization Shortcuts in LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:15.212310Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2601.11061"},"observation_digest":"sha256:726a647b1ec9cc160640aacc79b7d9294ab318d08852981341a28d0e33327f1f","observation_id":"b03b36f4-d86f-4452-be41-ff46f16d8cf7","resolution":{"observed_at":"2026-08-03T10:13:15.212310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-03T03:04:44.283684Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:44.283684Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:2e6ed777879dd9309994c177fa291902bf7e1ff50a7814eeb1cde9a956e101e1","observation_id":"2a3f5c8f-3e25-4b3a-b2a9-fe248c574759","resolution":{"observed_at":"2026-08-03T03:04:44.283684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T23:11:55.977680Z","title":"S., Xin, R., Geng, S., Wang, Y., Oh, S., Du, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-15T22:28:45.285943Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T23:11:55.977680Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2602.14872"},"observation_digest":"sha256:ad0cc7f2fe31c1956ce8250def913f864ffe17d6c02307b8d0d3b4099c3c6ba3","observation_id":"0359888a-b996-489a-a866-91570c1013e8","resolution":{"observed_at":"2026-08-02T23:11:55.977680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-17T06:37:12.876868Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T19:23:10.901441Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:ade6b2036ebeda470a037cccb4ce72e675cd1e2fa214a924717489fe74937ada","observation_id":"33539e0f-63bf-4dd7-99df-98f992a9cac4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T16:52:29.593103Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03472","last_updated":"2026-07-22T14:38:55Z","snapshot_observed_at":"2026-08-17T06:37:12.876868Z","submitted_at":"2026-04-03T21:40:03Z","title":"Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:29.593103Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.03472"},"observation_digest":"sha256:54fc4b15902e4ff4bc1fa6cfb74be489187742401eee0d53a5e99988675bf037","observation_id":"00440b3d-9da3-4d3c-9dec-6331025970ee","resolution":{"observed_at":"2026-08-02T16:52:29.593103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.15830","last_updated":"2026-05-01T11:47:10Z","snapshot_observed_at":"2026-08-11T11:12:43.791075Z","submitted_at":"2026-04-17T08:34:51Z","title":"Placing Puzzle Pieces Where They Matter: A Question Augmentation Framework for Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:30:40.368494Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.15830"},"observation_digest":"sha256:1f2c980979f1e6ad0bfc75f3682dba8e14def606aa5c6d39ff563153510a6532","observation_id":"888f70ca-4c29-4f1e-b9cb-33d0d227567c","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.16259","last_updated":"2026-04-17T17:17:55Z","snapshot_observed_at":"2026-08-12T19:06:49.955269Z","submitted_at":"2026-04-17T17:17:55Z","title":"Beyond Distribution Sharpening: The Importance of Task Rewards","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T08:07:14.691463Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.16259"},"observation_digest":"sha256:323c84eb8f20a7428544d8d56371090a30f19162c9e88b93040aa3952a62e322","observation_id":"766f1fee-28d3-414c-892a-3872cab38956","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17312","last_updated":"2026-04-19T08:01:31Z","snapshot_observed_at":"2026-08-14T08:49:25.826639Z","submitted_at":"2026-04-19T08:01:31Z","title":"A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T06:38:22.041842Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17312"},"observation_digest":"sha256:83d14880319f9fd499668946519b72c2b236edf785a33d7fca6ca31a4c3b35b2","observation_id":"fa7f8d2c-efbb-4c43-bc3a-a4de58daa56a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-14T08:41:23.060090Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:f950a239d2a4cbb11f78fce666052b4e7c42778d9777bc090ae20ef5b56c1d9b","observation_id":"c4a486c9-bda1-4833-9791-dc67fc342346","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-08-14T00:24:03.820656Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:6346e63b2be6383ce37420602a200b0269a83fd52019e780b53782d370c016e1","observation_id":"8597c541-ade7-44b2-990d-16382fbae164","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2604.23747","last_updated":"2026-04-26T14:53:48Z","snapshot_observed_at":"2026-08-15T12:19:15.764439Z","submitted_at":"2026-04-26T14:53:48Z","title":"SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-08T06:44:34.968571Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2604.23747"},"observation_digest":"sha256:8df5c7f6dbb49262f4e98bd69cfb72ef4860f30d8f54c2a1bba6eaf62a5bb5dd","observation_id":"c955551c-4937-4047-b106-13062012e8e4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:a4af5f7c78d810b9f441c108e8324ef48eaa9c0281999468a7f5d0e5afbe4863","observation_id":"9d6aea07-dd05-4d32-abd4-019fd8f4337e","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:aecc25cb1a411d32a2fdebc8163bb7dd666f366b6bf65e6367d3a717551a39a8","observation_id":"f0af7455-69d4-43f4-a332-c2eef49e8601","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02427","last_updated":"2026-05-11T20:46:44Z","snapshot_observed_at":"2026-08-13T09:14:39.265007Z","submitted_at":"2026-05-04T10:26:34Z","title":"The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-08T18:58:22.865080Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02427"},"observation_digest":"sha256:4377c8c2a874106678c74cf193d0422fded060cda48b745ef4efa61547d29f83","observation_id":"c23d3da4-be60-49fc-9edb-5f45b380306f","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02427","last_updated":"2026-05-11T20:46:44Z","snapshot_observed_at":"2026-08-13T09:14:39.265007Z","submitted_at":"2026-05-04T10:26:34Z","title":"The Model Knows, the Decoder Finds: Future Value Guided Particle Power Sampling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-13T02:14:17.870184Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02427"},"observation_digest":"sha256:5f16de324b7f1bc5bfcbac39524eeea8de74f9b8fa035ed82319d622e26c1e1b","observation_id":"c802e97d-8c70-4acd-bf93-69ab6ad87b2a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-08-13T10:36:16.468710Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:110681a507228b71fb921e2081783aa731a6e5371b0f4df8205091f9a2396b6c","observation_id":"3c315a2b-e9eb-49b3-ae7e-cf7e89165677","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.04542","last_updated":"2026-05-06T06:42:47Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:42:47Z","title":"Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-05-08T16:53:00.860162Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.04542"},"observation_digest":"sha256:f6693d8b877efa3445ebfc07a6f5c8ff1757db38f54e95535c5a4c405a4284f9","observation_id":"3d0b2257-17ee-4361-83c5-0afc8b6c230a","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-15T21:47:26.504858Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:075518ce1bef1e80f36d5fd42148958e4481b2ce98b794fe67b4f8e87801da6c","observation_id":"50827bcc-6bfd-4371-ba76-e13d04f92767","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.11813","last_updated":"2026-05-12T09:06:08Z","snapshot_observed_at":"2026-08-11T14:18:21.534370Z","submitted_at":"2026-05-12T09:06:08Z","title":"Automated Reformulation of Robust Optimization via Memory-Augmented Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T06:01:15.799220Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.11813"},"observation_digest":"sha256:a2da0561bbec4ba9fba5a41f62a9379c7b9c52870584c35c188331efffde91c7","observation_id":"1f867728-d6a6-491d-b6aa-2af9f8caa81e","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-13T06:08:28.855671Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:4d7f851c271aeefb3f4de524dd45d0dea52e59abeb5938c2f95cec2f59fd119e","observation_id":"cfdb2cf9-250d-4247-80ff-9601d85bf7b4","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12058","last_updated":"2026-05-21T13:10:04Z","snapshot_observed_at":"2026-08-17T23:14:19.646825Z","submitted_at":"2026-05-12T12:45:03Z","title":"Holder Policy Optimisation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-22T10:00:58.600743Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12058"},"observation_digest":"sha256:75707bc59922385e4f175a9aa95c21deaa78aa60a129f38f6b97693100576437","observation_id":"726a0883-aeaf-4dd3-a01c-6345737dee68","resolution":{"observed_at":"2026-05-22T10:01:22.952772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-11T10:04:43.760904Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:51.578772Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.12474"},"observation_digest":"sha256:80bae85244bda81a615c4a9046ccbf4dc7ede42e09b16948a3ac4687d54564f7","observation_id":"dc8355c6-b564-4f6c-a35c-fce4c1af9507","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.14445","last_updated":"2026-05-14T06:39:42Z","snapshot_observed_at":"2026-08-01T15:27:40.908509Z","submitted_at":"2026-05-14T06:39:42Z","title":"FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:02:25.597640Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.14445"},"observation_digest":"sha256:5a5e9066055b173d679660750e8e8410f4d1dceed3c6a1fe9a59955d6fdc42df","observation_id":"2a608b4e-ddbc-43ba-8a18-56c3a284fbe7","resolution":{"observed_at":"2026-05-16T13:37:51.161107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.20066","last_updated":"2026-05-19T16:20:57Z","snapshot_observed_at":"2026-08-13T04:21:51.850230Z","submitted_at":"2026-05-19T16:20:57Z","title":"Text-to-SPARQL Generation with Reinforcement Learning: A GRPO-based Approach on DBLP","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.20066"},"observation_digest":"sha256:e4e63210714cced51b9c4837f9ed2727fd9928f7efab8998280f73889fd860d3","observation_id":"982276db-f770-4500-a269-4fe318c9a47a","resolution":{"observed_at":"2026-05-20T05:33:03.662351Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:02:35.271960Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.20164"},"observation_digest":"sha256:f1e1237ab8789f2b73391a939e286b4393be6bfbc9011efbfe25d8a5ac2058b6","observation_id":"a9bcd287-bdb8-46ac-af5f-ae14cf350702","resolution":{"observed_at":"2026-05-20T05:03:03.508869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.29009","last_updated":"2026-05-27T19:04:35Z","snapshot_observed_at":"2026-08-02T13:50:50.347898Z","submitted_at":"2026-05-27T19:04:35Z","title":"Label-Free Reinforcement Learning via Cross-Model Entropy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T14:18:38.733276Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.29009"},"observation_digest":"sha256:1551b872972e88edcf4ec17871282f658d6c0abff5430c2f258c03ddd00333b6","observation_id":"25f5bb25-b4c2-4e0b-9f3c-1341ed627632","resolution":{"observed_at":"2026-06-29T14:23:30.616183Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.30327","last_updated":"2026-05-28T17:57:32Z","snapshot_observed_at":"2026-08-07T06:29:11.661418Z","submitted_at":"2026-05-28T17:57:32Z","title":"Reasoning with Sampling: Cutting at Decision Points","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T08:17:08.488565Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.30327"},"observation_digest":"sha256:88de7b87e4c44103960942ba8748443a30a5f97fd5088a594ef2f708799b7ec8","observation_id":"43107580-6423-41fe-8bb9-d97f04f04b5d","resolution":{"observed_at":"2026-06-29T08:23:15.534726Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2605.31494","last_updated":"2026-05-29T16:16:13Z","snapshot_observed_at":"2026-07-06T23:40:42.277618Z","submitted_at":"2026-05-29T16:16:13Z","title":"Consolidating Rewarded Perturbations for LLM Post-Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:37:34.673402Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2605.31494"},"observation_digest":"sha256:3628e263fdf5b272491e75e22b0c75cf8512e74583d0c1a50332945224d45c6d","observation_id":"fb845395-bada-49c1-aeb5-8b25ae86e72a","resolution":{"observed_at":"2026-06-28T22:42:46.870525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:128bc0c47b36c88d8dff1648de6cc452f60e04bf37055a23a93189e78f2b5c48","observation_id":"03f90375-e681-4bc1-915a-4f83010bb428","resolution":{"observed_at":"2026-06-28T17:22:24.873180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:b4106e6501eb8f975040f9db6ec136e361f1643f6b444a09ee6586a1c27f0115","observation_id":"c9a30e50-d8dc-478f-a9ed-d53e814b1198","resolution":{"observed_at":"2026-07-01T20:56:13.467969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.04516","last_updated":"2026-06-03T06:47:50Z","snapshot_observed_at":"2026-07-06T23:44:37.797802Z","submitted_at":"2026-06-03T06:47:50Z","title":"GeoMin: Data-Efficient Semi-Supervised RLVR via Geometric Distribution Modeling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-28T07:45:43.320339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.04516"},"observation_digest":"sha256:59314535aec77a719e2ca9af21480da5abc7bd6eb21192f611009f7f7fb07359","observation_id":"e8950c1b-8edd-464d-bc8d-23c354c61ced","resolution":{"observed_at":"2026-07-02T06:06:40.763205Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.05932","last_updated":"2026-06-08T06:52:09Z","snapshot_observed_at":"2026-08-14T18:33:26.564823Z","submitted_at":"2026-06-04T09:35:54Z","title":"A Pre-Registered Causal Partition of Self-Consistency Elicitation and Reward Design in RLVR","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T01:35:26.306648Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.05932"},"observation_digest":"sha256:30613dfdd5e6798208139e3c1492b3f8b4603e435cda4643fb30376e6e1339ec","observation_id":"e3aadc56-5a37-423e-a0c8-87ff3bbb679c","resolution":{"observed_at":"2026-07-02T13:06:59.082200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.06475","last_updated":"2026-06-04T17:56:31Z","snapshot_observed_at":"2026-08-16T10:36:39.076635Z","submitted_at":"2026-06-04T17:56:31Z","title":"RREDCoT: Segment-Level Reward Redistribution for Reasoning Models","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-06-28T02:12:16.029526Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.06475"},"observation_digest":"sha256:8b03da4ef6d18adacd1e17fc50c75e0ea9f16fdecc1cae694f7949e6e7fbd1ea","observation_id":"e497ec34-05e1-4055-b5dd-2c784799cdb0","resolution":{"observed_at":"2026-07-02T12:16:57.646397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-12T12:46:07.918657Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:0d876f5c4383df6a6701b95973312b3540576b667b96301683756ebba46cd263","observation_id":"4ca2855a-fccd-46ad-a9e0-0db11187f3a5","resolution":{"observed_at":"2026-06-27T13:20:56.495398Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-02T11:54:46.435397Z","title":"doi: 10.18653/v1/2023.acl-long.244","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10931","last_updated":"2026-07-17T04:23:35Z","snapshot_observed_at":"2026-08-12T12:46:07.918657Z","submitted_at":"2026-06-09T14:44:01Z","title":"It Takes One to Bias Them All: Breaking Bad with One-Shot GRPO","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T11:54:46.435397Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.10931"},"observation_digest":"sha256:f0574693ab530c7b279549a87d570af88ccf9f86a97bf2995bd65014f21dc436","observation_id":"028afbad-e9eb-470a-b0e9-1f03e1a6cc86","resolution":{"observed_at":"2026-08-02T11:54:46.435397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:034448b135480fe9d3d04d8af2afb3fb6d1afbbcf2a89ab8f6b6243cd4847876","observation_id":"701020a6-8764-4e8c-886e-c8bbc61bc510","resolution":{"observed_at":"2026-07-03T20:38:55.978596Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2606.26080","last_updated":"2026-06-24T17:54:08Z","snapshot_observed_at":"2026-08-02T15:38:18.729836Z","submitted_at":"2026-06-24T17:54:08Z","title":"Neglected Free Lunch from Post-training: Progress Advantage for LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T19:55:51.114244Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2606.26080"},"observation_digest":"sha256:94fa8e121a09e32a4d22a89c511a2e67db8fe606ab5eee32acae644bf3dd7a9f","observation_id":"45b40a9c-d615-4e3b-b516-ed6555117f7a","resolution":{"observed_at":"2026-07-04T20:40:07.890098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-16T21:19:53.274055Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:c6691cf31db03b57bd57970cd2d1f2878df6daa1d829823d5c197d459d528733","observation_id":"520d274b-f92c-4b51-a10f-b89807016227","resolution":{"observed_at":"2026-07-09T11:16:11.379832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":"2506.10947","doi":"10.3390/app14041521","metadata_source":"pith","pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","venue":"cs.AI","work_id":"8e05ef02-44f0-41ce-aea5-d954f72e9546","year":2025},"citing_paper":{"arxiv_id":"2607.07492","last_updated":"2026-07-08T14:53:55Z","snapshot_observed_at":"2026-08-16T07:40:00.537585Z","submitted_at":"2026-07-08T14:53:55Z","title":"Search, Fail, Recover: A Training Framework for Correction-Aware Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-09T09:20:08.212837Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.07492"},"observation_digest":"sha256:b65ee70e4f9e421e7c2059d0ba99af4b38b01ff650254ff043012399026910cf","observation_id":"07f73784-95e0-4cbd-8408-e75d5948032c","resolution":{"observed_at":"2026-07-09T09:26:08.755245Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-18T09:28:19.221363Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:9ed7875f3ccdbd7e3694333c8062f47f9692474c9f2ec7c48098288557e0317f","observation_id":"353c0b54-a1fe-4d06-adee-9740cc3fc99d","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-14T17:39:27.292075Z","title":"Spurious rewards: Rethinking training signals in RLVR","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09693","last_updated":"2026-06-19T12:36:23Z","snapshot_observed_at":"2026-08-15T23:52:47.483207Z","submitted_at":"2026-06-19T12:36:23Z","title":"Depth-Entropy Guided Sampling for Training-Free LLM Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T17:39:27.292075Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.09693"},"observation_digest":"sha256:5f09387e8cf74c3532eef2eb8cb134e9c2410b1068fe9baecffe35387b09fae5","observation_id":"35fffbe0-93cb-4d5a-8829-f4f83000f389","resolution":{"observed_at":"2026-07-14T17:39:27.292075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-07-14T07:36:47.336670Z","title":"Spurious rewards: Rethinking training signals in RLVR.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11022","last_updated":"2026-07-13T02:41:16Z","snapshot_observed_at":"2026-08-18T03:01:18.756974Z","submitted_at":"2026-07-13T02:41:16Z","title":"When the Reward Suite Is Leaky: A Preregistered Causal Contrast of Natural Verifier False Positives in RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T07:36:47.336670Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.11022"},"observation_digest":"sha256:dd772a22ddeba607fbae3f539e88726f506e128d809ece9fe27c7b5527950c2f","observation_id":"fb1244d4-f004-4d78-b606-b1105598a081","resolution":{"observed_at":"2026-07-14T07:36:47.336670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-01T17:47:41.835722Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.835722Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:95e65cc01a5abf86caccd306aa1749a7fba2e8b82f12b6111615c87b24074896","observation_id":"3348cd36-1e17-4155-90d2-f7211246e2ce","resolution":{"observed_at":"2026-08-01T17:47:41.835722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-04T02:03:05.632468Z","title":"arXiv preprint arXiv:2506.10947 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00019","last_updated":"2026-07-01T10:39:54Z","snapshot_observed_at":"2026-08-09T09:56:58.991511Z","submitted_at":"2026-07-01T10:39:54Z","title":"Uncertainty-Aware Simulation-Based Inference for Operations Research with Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T02:03:05.632468Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.00019"},"observation_digest":"sha256:c271f9450940df73621435ad9b232b00937163b4f63b8cf875891128ef188e60","observation_id":"66b24e57-486c-443f-a922-b8654f6369e8","resolution":{"observed_at":"2026-08-04T02:03:05.632468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-08T01:03:50.867049Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Mingchuan Zhang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03068","last_updated":"2026-08-04T03:30:59Z","snapshot_observed_at":"2026-08-18T16:47:19.778996Z","submitted_at":"2026-08-04T03:30:59Z","title":"CVPO: Enhancing LLM Reinforcement Learning Reasoning via Value-Variance Adaptation and Dynamic Curriculum Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T01:03:50.867049Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.03068"},"observation_digest":"sha256:349636a12d2ada2e95708fc6ef493cd0c1ea243a00c1882ef1647ac929c74683","observation_id":"d7ab1b69-45a5-4627-893c-40d3a1179c0b","resolution":{"observed_at":"2026-08-08T01:03:50.867049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-11T19:31:40.900230Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09324","last_updated":"2026-08-10T09:06:03Z","snapshot_observed_at":"2026-08-19T05:59:38.779754Z","submitted_at":"2026-08-10T09:06:03Z","title":"CoRE: Consensus Rewards via Equilibrium for Test-Time Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T19:31:40.900230Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2608.09324"},"observation_digest":"sha256:190c766b30d2978f3e5fd8a8ccba6dc63fb664967779642ad5e487656a5b7e76","observation_id":"972f5e9b-f015-43b8-ad1d-a35d8b32f25f","resolution":{"observed_at":"2026-08-11T19:31:40.900230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10947/citation-record","integrity":"/paper/2506.10947/integrity","json":"/paper/2506.10947/citation-record.json","paper":"/paper/2506.10947"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:3b4ebff4dec83126ac527d34073698a4629435d5806300a75a726aefbe031a33","observation_id":"4a385ed9-c2c4-4bf4-9ed3-c95874899ef5","resolution":{"observed_at":"2026-05-16T13:37:51.109158Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-13T19:38:05.434011+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T19:38:05.434011+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:d96c728790c6b92fd0a590f3e076e0733977408c15468c792430d2fff761a578","observation_id":"2dea4de5-be44-48d8-b64c-93c47805eaa6","resolution":{"observed_at":"2026-05-16T13:37:51.117231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-13T20:01:21.267324Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":"2505.22660","doi":"10.48550/arxiv.2505.22660","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Maximizing confidence alone improves reasoning","venue":"ArXiv.org","work_id":"471b6786-7627-4021-a6b3-7f5cd8c83643","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:aceb8d2784413b65b63970179a4e12fbf88fc45742fa054ccc3119ef584f6bb6","observation_id":"2a5e8549-3eef-4533-a2e1-d79e8df51518","resolution":{"observed_at":"2026-05-16T13:37:51.121149Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-industry","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 979-8-89176-288-6","venue":null,"work_id":"74d89fb3-6798-4148-af6b-9764a4f36db8","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:34373c8d723336c30ad33bc47423a5ba6e935bfa4f5ded5d1194b8edf3f9724d","observation_id":"c9d64740-703c-4c47-b418-e60d75ab1a8f","resolution":{"observed_at":"2026-05-16T13:37:51.104488Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-15T06:02:45.207770Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2502.14768","doi":"10.48550/arxiv.2502.14768","metadata_source":"pith","pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","venue":"cs.CL","work_id":"b1f42628-30b7-4593-80ff-813523035c23","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:5be24120d2e31549307823b5a6c4ad23cbf8478b2ceccbd771a230de27fd5e79","observation_id":"a1f7f2c2-4234-4f6a-ad6b-3b505e044238","resolution":{"observed_at":"2026-05-16T20:57:51.136140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:f85533cc1d4ad0446154ce259bcd719fa4aa2aad5ea9a2aec168fe770e5d52a2","observation_id":"59b052cd-f9ff-4880-9dd4-617d1ce15ab0","resolution":{"observed_at":"2026-05-16T13:37:51.113502Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"clipping bias","venue":null,"work_id":"130b4a2f-5056-459a-a994-a6cae743c98a","year":2025},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:cb3c57a58ca4d2729557d169a47731a0bd928b19e94b3b1babc3c67c732856d1","observation_id":"bde87d3a-33ec-4a7e-95c3-0ba6794ae34c","resolution":{"observed_at":"2026-05-16T13:37:51.151752Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0d64a84-0150-4eeb-ae1c-5e9733b3d950","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:1c71a8c8e47c507939b529f2a942af36fd0e347c0499fabe4ceaf36d73f6f727","observation_id":"973f233d-76be-4905-85e2-892b00cd5d91","resolution":{"observed_at":"2026-05-16T13:37:51.153992Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"r={r},θ= {theta}","venue":null,"work_id":"f788bd91-2d40-48f0-9170-e349fe1bb54d","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:6d7ced3561376721740a557266eed93256b87a8fb6991e2c71f437cc7f973243","observation_id":"600501ef-5d6f-4b5a-8405-621481040869","resolution":{"observed_at":"2026-05-16T13:37:51.156186Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bb43c893-dea0-4bcb-a0a3-1a80505b186a","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:7392ba56be31a37254807d4206de724473c470e8f48c9bca8f9e4091cd1622d1","observation_id":"4a01737a-1ad0-401c-ab0d-6290fa19e4f9","resolution":{"observed_at":"2026-05-16T13:37:51.158345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3f0313c-cbdc-4e49-b0da-a981fe060674","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:3f64d5a00dfb8be3896fe6d2169d6d9c05de726fc32afe2795d3d6e92b4a628a","observation_id":"41602f8a-22e4-4d04-b61a-fbd9a478714f","resolution":{"observed_at":"2026-05-16T13:37:51.160343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"da98d780-922f-4028-aa95-1441f2b3a0e2","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:5831e8ba5e96080065f44d59cff586bedd1ad1cdac06dea027a5e79aba38d8de","observation_id":"a629e801-ab4c-410a-b36b-3827bc20669b","resolution":{"observed_at":"2026-05-16T13:37:51.127702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3bd7daea-5c60-4d8d-8e19-da5f58f2dced","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:30c773465b68d08d4a1f2102af17b4ddf7dcc3a2840a4c74139b4b4856a92ab7","observation_id":"7076f53d-f1f8-474b-956c-aaddbd3892dc","resolution":{"observed_at":"2026-05-16T13:37:51.130453Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"942ce1dd-dd9e-4890-a48b-324257a02a8b","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:db20a2b1cefe0fd905a2b3f0d40c070f2fef55a3bdcd1fdf3b650ed8adaf0e65","observation_id":"da9ee582-868e-45f1-a06d-751106e9c93a","resolution":{"observed_at":"2026-05-16T13:37:51.132731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ebc88481-5906-4640-b54a-8de8fbab5a15","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:d42e983980c22a106e154d2e2c92d1d48ff47bb4d4ad09bb7c56587f879dec9a","observation_id":"d5deb67a-ce15-48fa-ac4b-50ebb92cbe7d","resolution":{"observed_at":"2026-05-16T13:37:51.135158Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b14b5c8e-148d-44cc-88ba-d5cc87b08f0a","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:c6b5a1fa5583e37b6c3a91bec6f0867657ad25ef1ed6864f7ee515911fa53b4e","observation_id":"6b536b42-0532-4243-8aa7-e0cc01c4a81a","resolution":{"observed_at":"2026-05-16T13:37:51.137643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e85d449-0f3a-4628-a33e-7ddac8d3998c","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:4ac34e8cc40f540fbde9d1083083e845a919c2226bc09be591f715e3e8afa91d","observation_id":"057e586d-008b-4832-b47e-429b76f7e8f2","resolution":{"observed_at":"2026-05-16T13:37:51.140204Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2eee1042-1971-4479-8b37-f59a86969537","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:630ead56e743a53e1f7abf07d4913abfe194dcefd09f48b5a2bb940fb53af26a","observation_id":"7916eca4-cbc1-4fb4-945c-9b1933db954b","resolution":{"observed_at":"2026-05-16T13:37:51.142465Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d88e066f-2b28-4e8e-bb53-68e33aef53e9","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:17ea6d9902603f069eb8160ea2aff6cc152eea6a0de6233cfedb9d8fba676a03","observation_id":"af755b84-41b2-4e3a-be8a-3ff8821da76b","resolution":{"observed_at":"2026-05-16T13:37:51.144688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e971e494-8715-4de5-bdf6-45abaabd41cf","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:ed3fa458f3c5c031bc8e0d3af46b2e57215336b5c4d5ea22e663b38f5c3a8ed9","observation_id":"a16ecced-68fd-4e4e-8c10-7cb5b99b973e","resolution":{"observed_at":"2026-05-16T13:37:51.146842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let’s convert10010 to base six using Python","venue":null,"work_id":"afb7ba5d-b771-4d2b-96cd-5f126e856f30","year":null},"citing_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T13:37:51.086217Z"},"links":{"citing_paper":"/paper/2506.10947"},"observation_digest":"sha256:95d447765306f1bcbf3406ee54259843f55ea40fe5d7243197271ccc8a610c03","observation_id":"f6993bc0-5fda-48f1-99e0-57f59dacc218","resolution":{"observed_at":"2026-05-16T13:37:51.149197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":2,"metadata_mismatch":3,"parse_uncertain":2,"unresolved":10,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 73 inbound Pith citation observations for arXiv:2506.10947."}