{"as_of":"2026-08-05T16:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6474e42d12c61e0b993926349e7e9d29fa5cb1d13e2f7d386b9439c8dc564558","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T16:24:43.688967Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:39:02.891861Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25872","snapshot_observed_at":"2026-07-13T02:39:02.891861Z","title":"When errors can be beneficial: A categorization of imperfect rewards for policy gradient.arXiv preprint arXiv:2604.25872, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09492","last_updated":"2026-07-10T15:06:48Z","snapshot_observed_at":"2026-08-02T02:14:15.956064Z","submitted_at":"2026-07-10T15:06:48Z","title":"Multimodal Reward Hacking in Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T02:39:02.891861Z"},"links":{"cited_paper":"/paper/2604.25872","citing_paper":"/paper/2607.09492"},"observation_digest":"sha256:45a619e147edd1d8ad2420d7aa0b1d568b5b4c434c86f93c479539c30370b4c8","observation_id":"28af7302-b8f7-4f48-885d-77815d82bb5e","resolution":{"observed_at":"2026-07-13T02:39:02.891861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.25872/citation-record","integrity":"/paper/2604.25872/integrity","json":"/paper/2604.25872/citation-record.json","paper":"/paper/2604.25872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift.The Journal of Machine Learning Research, 22(1):4431–4506","venue":null,"work_id":"f48dd2ce-e2b2-4c2e-9e8c-543107ace0dc","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:1ad10793ff4d70b90d14d43bc4b61dcf6809dcf966e2447d135ac1be9ae99f3f","observation_id":"7a34d8fc-b13d-43e3-ac7f-067bd024a5c4","resolution":{"observed_at":"2026-05-27T02:18:24.863945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:cee4f2f4787f093f0bb7154859666e836d6cf0f4450a2c161e5ea323e0051361","observation_id":"25482215-e86d-4465-b6c4-70102db495c1","resolution":{"observed_at":"2026-05-13T01:42:22.769824Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding the impact of entropy on policy optimization","venue":null,"work_id":"db4ed23b-146f-41cd-981d-b846ee40938e","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6c8140684ac530a44fdef6d6c402fc66d59805eb6daa773c62cd159e8c0b0e5e","observation_id":"bd5e698c-3480-452c-9ca7-4047323ee798","resolution":{"observed_at":"2026-05-27T02:18:24.904768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:62e8bc8a3daa958161876a444bc04b7da0987e9e584c5ca5fe2404a84261d130","observation_id":"0d54c6f2-c896-41a5-ac7e-88e78269e706","resolution":{"observed_at":"2026-05-11T23:41:19.510706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Potential-based shaping in model-based reinforce- ment learning","venue":null,"work_id":"a4f3582f-b8a4-4523-af02-c75894956c02","year":2008},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:d17adf9a72bff925646a59175935b2b4343b636344dbdc27cfe7998a81c07a7c","observation_id":"246d52d9-a8e3-4c28-b4bb-2de9932b416f","resolution":{"observed_at":"2026-05-27T02:18:24.984806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19792","last_updated":"2025-08-21T16:32:06Z","snapshot_observed_at":"2026-08-02T08:38:53.105103Z","submitted_at":"2024-12-27T18:45:36Z","title":"InfAlign: Inference-aware language model alignment","version":5},"cited_work":{"arxiv_id":"2412.19792","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.19792","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.19792 , year=","venue":null,"work_id":"764bf075-849d-414c-a67a-8bb4bc5670a8","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2412.19792","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:8ff4d915e6d3833a4de1834b9cd2f5ecb2b2d0d4cb852d6ba1d41700be90b9aa","observation_id":"b373cf31-2bdd-4a9f-9bfa-2a15ebe38687","resolution":{"observed_at":"2026-05-11T23:41:19.360622Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1912.06680","doi":"10.5281/zenodo.17096679","metadata_source":"pith","pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","venue":"cs.LG","work_id":"b047dc18-e9a3-4d11-8ff6-cd59d41a6357","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:868a707828419d8a226e18285866a12a9713a5e8acf98bf2b5f13a831ca72117","observation_id":"053b26ba-67ef-4828-a9e4-f1c62adc4f01","resolution":{"observed_at":"2026-05-12T22:18:16.018301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"590e694e-7478-47cb-b8f3-77b01812e2ab","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:d9dda44a4899edf335ebd8bca2d0e1c91d6b284d76fbaf8314c7fb8aa9120ea4","observation_id":"51e7cdf1-4e82-42b6-803e-d770919c1c2b","resolution":{"observed_at":"2026-05-27T02:18:25.100242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The accuracy paradox in rlhf: When better reward models don’t yield better language models","venue":null,"work_id":"106a6df8-d95b-4685-8a2f-a041d606d445","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:197cc92b91168c2fa8a120a3d035b50077adc33875371c96c731aa2383be8e6d","observation_id":"b77832eb-85f9-4636-a428-0ba3f8298037","resolution":{"observed_at":"2026-05-27T02:18:25.072863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Heuristic-guided reinforcement learning","venue":null,"work_id":"f8ba9027-b082-4702-8161-b34676eee498","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:22da285c1b811e0f0d0a119ae99bd840c9c29326938e7e3e2eeb26daa21f4434","observation_id":"b0803899-d69e-443e-b11f-e67df679bff4","resolution":{"observed_at":"2026-05-27T02:18:24.859056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning navigation behaviors end-to-end with autorl.IEEE Robotics and Automation Letters, 4(2):2007–2014","venue":null,"work_id":"2e4d69ea-2893-49f4-b682-c966faab0272","year":2007},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:5de133345255c4ff182e4c6cc42e4977cb8527566190a986801cf56b03eb96e5","observation_id":"d4899a4c-28d0-444c-a2f5-3d47850b65af","resolution":{"observed_at":"2026-05-27T02:18:25.013493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"More is less: inducing sparsity via overparameteriza- tion.Information and Inference: A Journal of the IMA, 12(3):1437–1460","venue":null,"work_id":"fc974175-acb6-4e5c-b355-7d782de47462","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:1bb438b970ec6e479d77488c62e5262be61b27685cdcdde0c5ab3b28f8bbd42c","observation_id":"2df8d76b-484d-47ff-a1e4-6730ad9ade43","resolution":{"observed_at":"2026-05-27T02:18:25.175394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":"067215b9-96ff-443b-9c21-0deb0c4f4419","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:3777ed2aba34aa6e8df5528d05b5b9e9db6efd9094bde915e459db7f1b4e9263","observation_id":"0bafe182-0e35-4c0b-bd22-7149147b4048","resolution":{"observed_at":"2026-05-27T02:18:25.068336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":"28f82975-143b-489f-bf2f-0f0fb521ef82","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:95427b446d4421088604a78fa5ad1fb80d00f4edb24724c56c5e263a1665b385","observation_id":"001ce548-e2a0-4a8a-b017-38e03f8407c4","resolution":{"observed_at":"2026-05-27T02:18:25.141787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maximum expected hitting cost of a markov decision process and informativeness of rewards.Advances in Neural Information Processing Systems","venue":null,"work_id":"13007ae0-a611-45fd-b37c-85c59076728e","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:7a31637b10ed7f55e54743048c29c6b2414c93ba094eac89d51e53b8f83ad681","observation_id":"b6bba76d-fb51-4eb3-8356-1311f0257689","resolution":{"observed_at":"2026-05-27T02:18:24.885611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploration-guided reward shaping for reinforcement learning under sparse rewards.Advances in Neural Information Processing Systems","venue":null,"work_id":"d7690027-e052-43eb-9257-850b0e1123a1","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:c8d57ce02cd7b56358c6824f61a0970e4eada0341044fc80103da6e714f20c28","observation_id":"3195c83e-82e7-4a9b-983a-e246baccc8b9","resolution":{"observed_at":"2026-05-27T02:18:24.838961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous vs","venue":null,"work_id":"86ff7565-44a8-4a7d-9ede-7c69eb6aa36a","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:8b90e65898ae251b0b85f5075772af0e21d2f6c331253ddaee8343dc5f24a15b","observation_id":"61d4bf89-748f-4f6b-87dc-723058a0a7dd","resolution":{"observed_at":"2026-05-27T02:18:24.868010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The perils of optimizing learned reward functions: Low training error does not guarantee low regret","venue":null,"work_id":"d8aedf38-0c74-4160-b5d0-b57a2f209de8","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6832efa1cd96d168183d3086d849bc3a4131e61f8486faee522ee4df14a9cc78","observation_id":"77b8edde-0e2a-42b1-b3da-fffbe35e77f9","resolution":{"observed_at":"2026-05-27T02:18:24.895553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is a good foundation necessary for efficient reinforcement learning? the computational role of the base model in exploration","venue":null,"work_id":"7d887a24-9346-447c-a64f-fc40ddc9bd74","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:7d0e5c76ac8f8306b6efbed4e90e8de7ff79930909e76cd9103343bbe558765e","observation_id":"e2304c86-3d52-4ac1-9fc0-d76092cecfea","resolution":{"observed_at":"2026-05-27T02:18:24.786800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How to evaluate reward models for rlhf","venue":null,"work_id":"bdcf7798-13d3-4a31-806c-c1d8451258d5","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:2faaf6c19247c9ce6f59d7e98bab0a09aa2fb075b23eaecb5b29f7f36c1d2467","observation_id":"d14e7f16-b218-42ac-aab0-be81f3b28c37","resolution":{"observed_at":"2026-05-27T02:18:25.123615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:30:09.680521Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":"52561758-0cb3-4ae1-8db4-d20a08e886a1","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:15fd087f7c2a15d167ed6d5785c6af2424bd9dcaec30c96a91f46ffb4564c1ad","observation_id":"39e03859-ef9c-4662-8d30-f9a6d8735a40","resolution":{"observed_at":"2026-05-27T02:18:24.805765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An alternate policy gradient estimator for softmax policies","venue":null,"work_id":"dde43152-ad91-4195-869b-a2ace6429d9e","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:919446c580dbaea71748713a5a20cd0c6544f6b27a1fffe0ded5511f0f374031","observation_id":"bacdaebb-550e-4a6d-8693-a5602a9b3cf6","resolution":{"observed_at":"2026-05-27T02:18:25.018960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantifying differences in reward functions","venue":null,"work_id":"06a9f865-8ec1-4338-9c6b-1ff54fb5179d","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:c67aa6798e9cc1b461db27fcd60b01e71e717e5df0f77aa82a62a39bdb7fe0f6","observation_id":"00c18eea-a1cd-4f85-95c7-8248d629d8c7","resolution":{"observed_at":"2026-05-27T02:18:24.828078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:aa8a752189027387af1017069b389371c93cc734c4570f4af167edb13c0b8a72","observation_id":"5ff05225-ae09-41cd-b833-66e2010ba483","resolution":{"observed_at":"2026-05-11T23:41:19.354997Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward shaping in episodic reinforcement learning","venue":null,"work_id":"20f705f2-5129-4376-8f8f-82bed26f5234","year":2017},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:978036b62a9ad5df08592e79557ade5347ee2cf69c9caba3ac684edbad63ad38","observation_id":"cd9ba846-5e88-440f-81d5-a62981433e19","resolution":{"observed_at":"2026-05-27T02:18:25.109371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:b5b0dfba234a2504ac685c68aa2d2dce758344a5bf0288f83e2b356885d07542","observation_id":"0cee9084-8afc-4ecf-b712-e6f53d50705b","resolution":{"observed_at":"2026-05-11T23:41:19.569181Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unpacking reward shaping: Understanding the benefits of reward engineering on sample complexity.Advances in Neural Information Processing Systems","venue":null,"work_id":"48ba75c0-fdbe-4c6f-9b1f-1dff64cf6cbf","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:0009753f44039c3e62a974bb5e7c878f4cb72a28a09ec5a89495e4052133efa1","observation_id":"b2b53894-57f5-4717-aae4-3f45bd19d9af","resolution":{"observed_at":"2026-05-27T02:18:24.795897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00190","last_updated":"2020-02-26T13:26:41Z","snapshot_observed_at":"2026-08-05T08:01:00.912866Z","submitted_at":"2019-06-01T09:18:48Z","title":"Neural Replicator Dynamics","version":5},"cited_work":{"arxiv_id":"1906.00190","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.00190","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural replicator dynamics","venue":null,"work_id":"37460f0f-9bed-43b4-bf3d-d01868e6689e","year":1906},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1906.00190","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:222b5bbb105427bbb16de87942125a65c4ad920267aa7b30eec6a8b6e388ef3b","observation_id":"e8bd2e1e-9a1d-4d8e-bf3e-e7939a5ca7fe","resolution":{"observed_at":"2026-05-11T23:41:19.370655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Is best-of-n the best of them? coverage, scaling, and optimality in inference-time alignment","venue":null,"work_id":"615f6468-9bc7-414b-997a-8168c124876f","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:8f1ece416b79ad7abebe38ff26dd060ac75354d6d0a873a56994f86db305fa9f","observation_id":"a9db3d6b-33f0-4820-b168-cb647a65ce88","resolution":{"observed_at":"2026-05-27T02:18:24.843538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14872","last_updated":"2026-06-29T01:04:09Z","snapshot_observed_at":"2026-08-02T23:11:47.613570Z","submitted_at":"2026-02-16T16:03:08Z","title":"On the Emergence of Implicit Curriculum in RLVR Learning Dynamics","version":3},"cited_work":{"arxiv_id":"2602.14872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.14872","snapshot_observed_at":"2026-07-02T02:56:29.139436Z","title":"The Implicit Curriculum: Learning Dynamics in RL with Verifiable Rewards","venue":"cs.LG","work_id":"b078b267-c10d-4a36-88a5-7bee845fc37b","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2602.14872","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:2a0552ce1e4f407d71fc513a48ac69e1e59855ce5695b0bb14e2f2797847637b","observation_id":"2e768850-5d4d-4dc9-a3bf-9d122f133052","resolution":{"observed_at":"2026-05-11T23:41:19.411893Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.22203","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T06:06:40.751284Z","title":"Pitfalls of rule- and model-based verifiers–a case study on mathematical reasoning","venue":null,"work_id":"606127e0-cfd7-4548-893d-87fb5c3ea69e","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a5ee1c95e8992a2cd8ce482a285e165c0ae011fa27de834c942e366c26adae45","observation_id":"f4292780-bbe9-47f2-8cb6-4447e8fb1132","resolution":{"observed_at":"2026-05-11T23:41:19.516586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goodhart’s law in reinforcement learning","venue":null,"work_id":"2eb41eed-b5e5-49f6-ad06-4d14d44eab5a","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:bfbee86380624b947f12d51cb29841c3e1c791de8740ecb1980513bfac97a58f","observation_id":"79356e28-dcfb-46ca-b1ba-7c2e125cd99e","resolution":{"observed_at":"2026-05-27T02:18:25.119332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond stationarity: Convergence analysis of stochastic softmax policy gradient methods","venue":null,"work_id":"c248ce2b-3e3d-45b9-89dc-ca9da3f390d3","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:255d4c07bd9a63ec9feeddda41ab8a578fa14344d2169aaa55b0e7d38b5d4553","observation_id":"9ee1562b-2bad-4ee7-994d-05965bcfd311","resolution":{"observed_at":"2026-05-27T02:18:24.890286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Buy 4 reinforce samples, get a baseline for free!Deep Reinforcement Learning Meets Structured Prediction ICLR Workhsop","venue":null,"work_id":"2669a694-7e38-4302-9974-82f0223a7448","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:d6ba5e74a15366eb3dfd85a238019b311a55d90bfecddc14de6fcb5a3e84d603","observation_id":"7b1c7b91-3a83-4ce4-819c-d1c6b11ad14f","resolution":{"observed_at":"2026-05-27T02:18:24.800342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A neural collapse perspective on feature evolution in graph neural networks.Advances in Neural Information Processing Systems","venue":null,"work_id":"58cf966e-b86c-4854-8d7e-34c5ec95d005","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a373daf58d554b4d9a5b1508b15d6423254cf530117009cacb780957dc15f362","observation_id":"c313ba31-c8b0-4040-8b8d-569a560a30e6","resolution":{"observed_at":"2026-05-27T02:18:24.791469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking","venue":null,"work_id":"79e458fe-442b-4312-888d-3db01e203632","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:e9b792df93b3f79186d643dbd0671ccc76d291406f97f595ed2e009896b6fb29","observation_id":"9f74ff2c-b947-4f68-b9c1-2b78bd4fd77a","resolution":{"observed_at":"2026-05-27T02:18:24.777821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:4a48528fb0e57d8ea6cb252cc3da9ee6ac57a9a8b3fe2bf4b616a32829fef5bb","observation_id":"b79c9aee-6548-486f-8dd0-87ec58fd2409","resolution":{"observed_at":"2026-05-11T23:41:19.452354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":"1e2cc495-1a8b-41c2-a7b0-f4fa138439e2","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:3f8fdbe140c2d94468a3617395177943cc8af216331c55f3576ba77ffe4153ba","observation_id":"6b3e9138-9638-4f18-9945-7bf498b74769","resolution":{"observed_at":"2026-05-27T02:18:24.880935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The influence of reward on the speed of reinforcement learning: An analysis of shaping","venue":null,"work_id":"64861d93-2751-4968-aa9d-a50253e1ce7d","year":2003},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:212c7d54299b8e704a8779e1ac1f86e05aacd7dcff8c5cf7fe0027028c135805","observation_id":"a9957a1d-b670-4804-bde9-34413deea7cb","resolution":{"observed_at":"2026-05-27T02:18:24.810202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Softmax policy gradient methods can take exponential time to converge","venue":null,"work_id":"da73a932-5ef6-4d69-8c94-0a6ab54ec2d2","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:704890dfa49b3cd2ec89f6f0c9bea06275fd5c133e565444ce8476fbcb50acf3","observation_id":"c5b2414b-01f3-4776-957a-58931e1a29a7","resolution":{"observed_at":"2026-05-27T02:18:25.160033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T06:46:03.329499Z","title":"Hashimoto","venue":null,"work_id":"f6bb2597-5a11-426e-856c-0c8371b32056","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:87167d3cfeb1b7e48cc0575d3908403211838cce6cacd9e38b9617589efef62f","observation_id":"3acb3b2f-9de6-41fa-b43c-54d351479c5a","resolution":{"observed_at":"2026-05-27T02:18:25.170643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03155","last_updated":"2025-05-06T04:03:06Z","snapshot_observed_at":"2026-07-06T21:19:24.723379Z","submitted_at":"2025-05-06T04:03:06Z","title":"Rethinking the Global Convergence of Softmax Policy Gradient with Linear Function Approximation","version":1},"cited_work":{"arxiv_id":"2505.03155","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.03155","snapshot_observed_at":"2026-06-30T12:04:38.841090Z","title":"Rethinking the global convergence of softmax policy gradient with linear function approximation","venue":null,"work_id":"e783c080-3850-4d90-8bb3-21cc4886772c","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2505.03155","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:d07ffdfb480f617de11e6689d5606c64cb97e9cb4928aad013614197558e4fb3","observation_id":"054f8504-b2e6-4b03-a827-9ab741972c4c","resolution":{"observed_at":"2026-05-11T23:41:19.689881Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01352","last_updated":"2026-03-02T20:56:17Z","snapshot_observed_at":"2026-08-04T07:18:25.941807Z","submitted_at":"2025-07-02T04:40:29Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","version":3},"cited_work":{"arxiv_id":"2507.01352","doi":"10.48550/arxiv.2507.01352","metadata_source":"pith","pith_arxiv_id":"2507.01352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skywork-Reward-V2: Scaling Preference Data Curation via Human-AI Synergy","venue":"cs.CL","work_id":"c44139eb-e611-43d2-80db-eaecb038fe32","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2507.01352","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:0f9198b8c1b9048a82fecfd9a4e50387370de019e895934287d85e89b973077c","observation_id":"8e41e6ee-74ea-4de0-96cb-53143922b22e","resolution":{"observed_at":"2026-05-16T22:17:43.404381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03372","last_updated":"2024-04-11T02:59:07Z","snapshot_observed_at":"2026-08-05T09:15:12.934589Z","submitted_at":"2024-04-04T11:16:16Z","title":"Elementary Analysis of Policy Gradient Methods","version":2},"cited_work":{"arxiv_id":"2404.03372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03372","snapshot_observed_at":"2026-06-29T08:23:15.210988Z","title":"Elementary analysis of policy gradient methods","venue":null,"work_id":"c2bfbf70-d7d9-42cb-94b1-bd65181249bd","year":2016},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2404.03372","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:16907347870fac2f5e230b4458ea5b9e0921f634d3dabc4008487e3d4e2e6e1b","observation_id":"78f1a5c5-0921-403e-ae92-c241984b705b","resolution":{"observed_at":"2026-05-11T23:41:19.581704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RLTF: Reinforce- ment learning from unit test feedback.Transactions on Machine Learning Research","venue":null,"work_id":"52f9cd4b-07b3-4c31-84eb-8f0f55bc9db7","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:73bd3f5b7fdd7e2f2cbbb92bd5899f686e75ca079c03a965b0d97308ae8b291c","observation_id":"dcfc11c6-1ee1-4546-b85c-2d855129d2c7","resolution":{"observed_at":"2026-05-27T02:18:25.150697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rm-bench: Benchmarking reward mod- els of language models with subtlety and style","venue":null,"work_id":"900d467b-9a9a-4153-adee-d82c067c88c2","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6663f60c5eb54242b403afcd484a82e5ebce9e77f672911408d944c0ded27f00","observation_id":"6c70cdc9-b1a0-4538-86f7-feb0e02f2e9c","resolution":{"observed_at":"2026-05-27T02:18:25.050469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"cited_work":{"arxiv_id":"2506.01937","doi":"10.48550/arxiv.2506.01937","metadata_source":"pith","pith_arxiv_id":"2506.01937","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"RewardBench 2: Advancing Reward Model Evaluation","venue":"cs.CL","work_id":"cbae7eaf-ed34-46d3-9722-9c73b1ab5f5b","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2506.01937","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:9b700815810526184466ca317a9c795b2f5ef9e85a11307f96a40f24cae4a778","observation_id":"d310456e-86a5-4dd7-a59d-3dad4320a502","resolution":{"observed_at":"2026-05-11T23:41:19.467386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward engineering for reinforcement learning in software tasks","venue":null,"work_id":"a02d4aa5-e6ba-4931-bf36-8510e9c22861","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:e019833aa7003c0b1e3bda0506dfc64e14e883a135ac993219c43094c04c5e46","observation_id":"da614b5e-a305-461e-a951-b4d3dc04a718","resolution":{"observed_at":"2026-05-11T23:41:19.440658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward functions for accelerated learning","venue":null,"work_id":"31d6701d-d810-4f6e-af8b-d97bf21ab5fa","year":1994},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:0d6af986d4e0298ce3445cd705d0f36dc5d1d4b32be74490adf92ec2a0f8825c","observation_id":"0c30e2b3-8a65-4ef6-aad2-cc8f10b05a47","resolution":{"observed_at":"2026-05-27T02:18:25.059742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Escaping the gravitational pull of softmax.Advances in Neural Information Processing Systems","venue":null,"work_id":"5974d07f-0f13-4835-ade7-f403e0ff83cc","year":2020},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:4fca29dd079d749d1d7d2ccb19f8bbd4e9fcfab935b085e7f53d0d16ef4086de","observation_id":"c95685b4-ae34-43b6-b82a-ae9695cbb204","resolution":{"observed_at":"2026-05-27T02:18:24.999383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"11b97595-24f8-41e4-9ac8-fec2a2feb1b8","year":2020},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:b6121e557bc899b0d0da2e5a5a81bd5bde5e49a33329191ac8081bab3971e19b","observation_id":"3d0dd837-3d61-420f-bbb6-f7eb95c65c0d","resolution":{"observed_at":"2026-05-27T02:18:25.146068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Leveraging non-uniformity in first-order non-convex optimization","venue":null,"work_id":"a56edb09-aebc-4ca8-b08f-fc34fb6d78f8","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:788a4b12c29d2c1f612be8f92b16e009de29516201bdb0cf6171208b728280c9","observation_id":"960fb550-3502-4e22-9e08-65740ce9b899","resolution":{"observed_at":"2026-05-27T02:18:24.782435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ordering-based conditions for global convergence of policy gradient methods.Advances in Neural Information Processing Systems","venue":null,"work_id":"3ceaff6a-f806-4f3f-b473-870eb8fda2b9","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6e9ce490b296c1f2ef16bce5851c49d6248cfb089c092e1e29a7882d9b6e4281","observation_id":"248c8549-954e-416d-8029-11395b13baf0","resolution":{"observed_at":"2026-05-27T02:18:24.872459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stochastic gradient succeeds for bandits","venue":null,"work_id":"3a7703db-6b2e-4d0e-9890-509d55691e14","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:fdc0a53e6812ed40150065d65590d3c0592ee0651ea9b7fcbcfd05f80ccfe312","observation_id":"33d3b4f0-5ba3-434f-ae45-e150ee40740d","resolution":{"observed_at":"2026-05-27T02:18:24.823342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"3eb7e77d-7394-437f-ba2f-672312ba91de","year":1999},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:2e5d54d1f73e792a0de2a6548f8b1dd6ff98018ad859b9c4cbd63ffd546f79b3","observation_id":"987f6b8a-5dfd-40a6-9e92-7c999a5a1dde","resolution":{"observed_at":"2026-05-27T02:18:25.032695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-07-06T20:15:22.511263Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":"2501.00656","doi":"10.48550/arxiv.2501.00656","metadata_source":"pith","pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2 OLMo 2 Furious","venue":"cs.CL","work_id":"9ef0dc2b-fdfe-4f14-b235-ef7556dc709a","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:168de18cc2402cad8b4580e5e9de7455170c0db73caec549292fc99f93e6a825","observation_id":"e28f85ac-e154-4a89-a61c-b8fa25db28e3","resolution":{"observed_at":"2026-05-11T23:41:19.431341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:24.20254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:bc2a40173c65f8a78ae6cc2819373262f1c97ffda2500955d4d687d3504a65ef","observation_id":"a170f578-7634-4aa8-bc62-0b5865648f16","resolution":{"observed_at":"2026-05-11T23:41:19.524345Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback.Advances in Neural Information Processing Systems","venue":null,"work_id":"9f2d0138-f000-4ab2-b2ad-84792a66ad8a","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:e1b0270c8519a00d0aad72e9083dea7814ebc25f7b2a49d3a5f5a64cf28d89ff","observation_id":"519a7f06-fdb2-4a40-8947-523801103c68","resolution":{"observed_at":"2026-05-27T02:18:25.055485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward gaming in conditional text generation","venue":null,"work_id":"7f5851ee-5781-4126-88a3-a309acb8d474","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6aaaa1bde3e87234af476e0e54e724a06b5c3db7d819b0e4231ac57e643dc5d2","observation_id":"e0aef6b5-3da2-4eea-b445-f7fab22c60b0","resolution":{"observed_at":"2026-05-27T02:18:24.900348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"84ad21b5-d213-423e-b091-c95c4eff06b9","year":2017},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:78cf42e78c7ad1022c58e96713f12141e1f9ebbf40e97df12db82587999481db","observation_id":"30751c67-af25-4434-8dad-9db33a339f83","resolution":{"observed_at":"2026-05-27T02:18:25.082466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amp: Adversarial motion priors for stylized physics-based character control.ACM Transactions on Graphics (ToG), 40(4):1–20","venue":null,"work_id":"6bac932b-bae2-41cb-b07d-ca5a9be44b54","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6e866a8abb39274a3548dd307a12292fb43785df94ad254725da94b5e76414bc","observation_id":"57dbbfe6-b229-48be-a261-b000c3d43132","resolution":{"observed_at":"2026-05-27T02:18:25.155802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalizing verifiable instruction following","venue":null,"work_id":"a1291424-3e9e-43ee-8891-2c299998eefd","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:f3321738f7768bdf528273ccafcfc3d3c7c60a4270eb8d5d089a7031f877a5d9","observation_id":"dd783c71-682e-4090-993b-c31105667067","resolution":{"observed_at":"2026-05-27T02:18:25.037042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15158","last_updated":"2026-06-03T13:13:08Z","snapshot_observed_at":"2026-08-03T09:02:20.300747Z","submitted_at":"2026-01-21T16:36:19Z","title":"Outcome-Based RL Provably Leads Transformers to Reason, but Only With the Right Data","version":4},"cited_work":{"arxiv_id":"2601.15158","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.15158","snapshot_observed_at":"2026-06-28T23:32:47.550398Z","title":"Outcome-based rl provably leads transformers to reason, but only with the right data","venue":"cs.LG","work_id":"debbdb9d-9f3d-4b9e-a6a7-9f32004d1894","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2601.15158","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:e2be663b574c70de057013146831230233a716341b529bfa8e03ca66ba21a10f","observation_id":"097d2b6e-9754-4d08-8403-6e69c16330f1","resolution":{"observed_at":"2026-06-04T02:07:08.062014Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to drive a bicycle using reinforcement learning and shaping","venue":null,"work_id":"1c62d254-4ab6-4286-a9ea-d86ee501b887","year":1999},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:6345fec376d236dbb44f1e9026c9633e1eacc6e498a7bbec64b45bfcc9aaefbd","observation_id":"1760c012-5233-4b15-9b96-c2cf885b0f2f","resolution":{"observed_at":"2026-05-27T02:18:24.834343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit regularization in deep learning may not be explainable by norms","venue":null,"work_id":"0f9fba85-39e5-4666-a8d4-253ee046fefb","year":2020},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a6f69a07e8e8eccb762c12ac9ed251fea6a37716045035b64213c181f213b4b7","observation_id":"ad7c4af3-c797-4a68-afb8-233e215bcba2","resolution":{"observed_at":"2026-05-27T02:18:24.994339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit regularization in tensor factorization","venue":null,"work_id":"75f72df2-a604-42af-b706-45bc6f2bac65","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a9b4d72b718b9de4572006d5f27540513b42a034462db69aae9b6e07ee2707f0","observation_id":"10457d44-eb20-4523-a1c2-b0ab66501224","resolution":{"observed_at":"2026-05-27T02:18:25.091425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit regularization in hierarchical tensor factorization and deep convolutional neural networks","venue":null,"work_id":"1f9cb0dc-8938-41dc-af22-2e77ce0723fd","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:cee664f83453c60490b6623047dbd8fcf129517b8550de2da75712bd829ed1a9","observation_id":"efc34028-c14f-4e67-a47b-ed586a5b2417","resolution":{"observed_at":"2026-05-27T02:18:25.004683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Susskind, and Etai Littwin","venue":null,"work_id":"ebc7a4da-213b-4a66-a951-d9a4d2f91add","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:309584bac9c1f70f0102c4222b8e8c7e801681154498c823b0d56da0acdddd60","observation_id":"471d2902-ec56-4d25-a6a4-00650a010efd","resolution":{"observed_at":"2026-05-27T02:18:25.028147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What makes a reward model a good teacher? an optimization perspective","venue":null,"work_id":"27bc67f6-b733-4f02-9ad3-ab56f3554561","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:958f1574d636b2cecc9d64f319d29d30412c891304f3df5fd77cac2731df9391","observation_id":"5b1a8b75-d679-4728-8d7b-6f986db2992e","resolution":{"observed_at":"2026-05-27T02:18:25.095922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Why is your language model a poor implicit reward model? InInternational Conference on Learning Representations","venue":null,"work_id":"38ff239b-73f9-4eba-80e2-589a94a2c46c","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:c7931e99b744ad783d78fa3c4f5866c0096ee8d4630595b4cdc1454454ed9c04","observation_id":"d585a040-940a-4d8f-be86-bd62a25510d7","resolution":{"observed_at":"2026-05-27T02:18:24.854294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the effective number of linear regions in shallow univariate relu networks: Convergence guarantees and implicit bias.Advances in Neural Information Processing Systems","venue":null,"work_id":"34e5f471-2b6c-47d3-a097-c3c7226489c8","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:ae8c15d559322f1bf781da43e8a53469a67872fa650a0426f881a98fa1a2025d","observation_id":"cee29f65-6e2d-4f9f-aa72-c6d6a227f58c","resolution":{"observed_at":"2026-05-27T02:18:24.773208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exact solutions to the nonlinear dynamics of learning in deep linear neural networks","venue":null,"work_id":"bc93a634-af4c-4143-a814-c3c0147b32ca","year":2014},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:ad1c0630e86559cf104ea75926b873beaad5398c4c15577b309166a398b824f0","observation_id":"4b9d81ba-92ac-41be-82b4-16e2a588389a","resolution":{"observed_at":"2026-05-27T02:18:24.848707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.11455","last_updated":"2019-04-25T16:54:02Z","snapshot_observed_at":"2026-08-03T16:21:19.530326Z","submitted_at":"2019-04-25T16:54:02Z","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1904.11455","doi":"10.48550/arxiv.1904.11455","metadata_source":"pith","pith_arxiv_id":"1904.11455","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ray Interference: a Source of Plateaus in Deep Reinforcement Learning","venue":"cs.LG","work_id":"3b17ad45-c02e-4d5e-9d44-1e10d61ab2d1","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1904.11455","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:78e6e9c34cf38ab93cf0389ac826874de52a93484a0b1ada214e9e95e06c532b","observation_id":"903a3577-8159-47d5-953b-5ea29d577059","resolution":{"observed_at":"2026-05-11T23:41:19.487655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:94e16a9025a0136f7324f45e686f96aa31c498b3f4e9f73a143890d92baed776","observation_id":"16b258bc-2c08-45a3-bc04-c0cba41e2226","resolution":{"observed_at":"2026-05-11T23:41:19.387711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:7dec29afcfd886a723bf5eb4ce62ba7764b95c42760d9a2547c80b4b6e7804f2","observation_id":"4d69d36c-3d2d-4992-a032-4116c8f57c0b","resolution":{"observed_at":"2026-05-11T23:41:19.624857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Intrinsically motivated reinforce- ment learning: An evolutionary perspective.IEEE Transactions on Autonomous Mental Development, 2 (2):70–82","venue":null,"work_id":"acf454a7-5d80-4e82-b301-b6c996cae37a","year":2010},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:f4939bade23961e642b664b8d3e429cf0b6cdc6e9057fc2459cd54f771d63474","observation_id":"3c3ce965-d6d4-4970-8910-bca64027c993","resolution":{"observed_at":"2026-05-27T02:18:25.132804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defining and characterizing reward gaming.Advances in Neural Information Processing Systems","venue":null,"work_id":"204f88e7-c65d-4757-8f2d-5919e2d8c20b","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a34944bc658f5b7fb146dde0a19898c68acf1be4c1d342fcb43018f97958f89f","observation_id":"f18a4585-de3d-4add-b1dd-e5088a989381","resolution":{"observed_at":"2026-05-27T02:18:25.041345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Starc: A general framework for quantifying differences between reward functions","venue":null,"work_id":"5448ad10-3ac5-4bd3-b88d-737d9eb0f8e1","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:e90954d851ff1538a47ad1a20e18cb9a21d6b40d38163ff658ce31ab12d15701","observation_id":"4685644c-8a2c-47f1-a102-03505ab7b8ff","resolution":{"observed_at":"2026-05-27T02:18:25.045761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The implicit bias of structured state space models can be poisoned with clean labels","venue":null,"work_id":"bded8560-af27-481b-9d9a-b1a400fca0ce","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:06d2c86b4c5e05f306dc7f49d7024eb5018633d856e3121322a472f00367f1d2","observation_id":"ff578be5-2523-4960-adf2-91febc47327c","resolution":{"observed_at":"2026-05-27T02:18:24.814814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward design via online gradient ascent.Advances in Neural Information Processing Systems, 23","venue":null,"work_id":"39a90aad-3bdc-42ba-9a55-010ecc87fcdb","year":2010},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:9895448e0ce69aea6670c6e86d030cbacc1dfc88f5e2e7201143a74f9151adba","observation_id":"8052fc45-4fd5-4da8-9a7f-298f85c40e55","resolution":{"observed_at":"2026-05-27T02:18:25.127911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"e804d618-b985-4b89-b7d9-25814e52898f","year":2020},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:4273ad73fd14ecd3f3343b75fda621c5e36299b2b5a7e866a419621d995c9d2b","observation_id":"5ad401cd-72af-4fef-8bb7-e731b91238ce","resolution":{"observed_at":"2026-05-27T02:18:24.876597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rl grokking recipe: How does rl unlock and transfer new algorithms in llms? InInternational Conference on Learning Representations","venue":null,"work_id":"f56753bd-a9c7-4acc-9676-6e01bad4b165","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:ad9e7c49a2cbd4a0dac15aa68cb159964c403eba746bc9962cecb959ea4192f2","observation_id":"2ae292cf-cc5a-4eb9-afaf-454659e56a41","resolution":{"observed_at":"2026-05-27T02:18:25.105202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"All roads lead to likelihood: The value of reinforcement learning in fine-tuning","venue":null,"work_id":"5ee5b1a3-fb28-462e-9803-408b456d6867","year":2026},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:8be2706c29b8fe4b7c59aedeff6110763cb486c5811d57c186c94a417beefa48","observation_id":"33501b71-3632-4fad-8b33-1198ac9fb464","resolution":{"observed_at":"2026-05-27T02:18:25.063971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08448","last_updated":"2024-05-14T09:12:30Z","snapshot_observed_at":"2026-08-05T00:57:12.421643Z","submitted_at":"2024-05-14T09:12:30Z","title":"Understanding the performance gap between online and offline alignment algorithms","version":1},"cited_work":{"arxiv_id":"2405.08448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.08448","snapshot_observed_at":"2026-07-02T03:46:33.108981Z","title":"Understanding the performance gap between online and offline alignment algorithms","venue":null,"work_id":"92c35cdc-3e32-404d-a038-8a1f4228a044","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2405.08448","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:f09e3992e98c0cab5abe187b3528c571857fc11c031f20c347474711e143ac0c","observation_id":"82c9f1d3-92ad-4d9d-ba59-3a1cf0f06f06","resolution":{"observed_at":"2026-05-11T23:41:19.645340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:16:11.302873Z","title":"InThe Thirty-ninth Annual Conference on Neural Information Process- ing Systems","venue":null,"work_id":"30679b6f-ceed-47ea-bf15-78be35247157","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:abc114e6dfb69d64652878ffc20f49b3f238b4f9e5f10c5e7cd0de81667dbebd","observation_id":"530bd498-9511-42bb-ac2e-50bc6c38d329","resolution":{"observed_at":"2026-05-11T23:41:19.591630Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perturbation analysis of neural collapse","venue":null,"work_id":"921280a2-412e-40de-b253-f64bb3767f50","year":2023},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:774bce542745298c34b3b8db157377ee37448853105bb984d738e9b557e92f27","observation_id":"e9020eb9-ad60-4f07-bbc6-55043e5a9723","resolution":{"observed_at":"2026-05-27T02:18:25.137475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implicit regularization in relu networks with the square loss","venue":null,"work_id":"9edd0008-b54e-4314-bf8a-06be50e612eb","year":2021},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:2eb2cca2f701aaf32cc9f178e3051f324de35fd6adbd649940d7ea320806c98c","observation_id":"f6f5f133-7298-4f34-8121-1faf2ea73373","resolution":{"observed_at":"2026-05-27T02:18:24.819104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-07-06T18:33:11.370375Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2406.12845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-07-04T13:49:52.398618Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"a0d3f792-49d2-4bfb-ba7e-b4cdf3bd3fd6","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:9d2b7c10c16120090baf08eca6b3ba6cc8ae9025d0a5c3ddbc2e2814ab224ec5","observation_id":"78c93807-1306-4273-b3fb-328262e3caf1","resolution":{"observed_at":"2026-05-11T23:41:19.698135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking reward model evaluation: Are we barking up the wrong tree? InInternational Conference on Learning Representations","venue":null,"work_id":"c52adc85-ee5d-432c-be08-acc408c129d7","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:bc331c5e3b89a6fd117fcc29c73c0c08cd456cad9d450d8050147c7e87e9ffbb","observation_id":"97aadcd7-abbf-4da2-a2fc-00e035fbd907","resolution":{"observed_at":"2026-05-27T02:18:25.114951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning.Machine learning, 8(3):229–256","venue":null,"work_id":"4e9206d3-e256-40d3-969c-bc4de301595a","year":1992},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a840c1704667370679cab172ac1dea91788bea3656d5ed6b5b0dd65a99aed0ce","observation_id":"a299a1bd-a796-466a-bc73-4d8fd1093a67","resolution":{"observed_at":"2026-05-27T02:18:25.165478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":"1910.03771","doi":"10.48550/arxiv.1910.03771","metadata_source":"pith","pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":"cs.CL","work_id":"9d86da8d-01d3-41af-a0d2-ee14897927a9","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:78f2b604e8e11d5b04802374a722eafd899e7a527d2f8e5a397a966da8b08b5d","observation_id":"ee639010-6b2f-4c5c-81d1-f0e14cb02f1c","resolution":{"observed_at":"2026-05-11T23:41:19.611570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kernel and rich regimes in overparametrized models","venue":null,"work_id":"1f2729e3-4311-400e-b6ef-ebd2550893dc","year":2020},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:ac6ffc9c7fb12bb9201437ddfceecbe426dc68669729819d103f1f83d0e6021b","observation_id":"df978ab5-46a8-4420-8cba-df6b7d5ccc91","resolution":{"observed_at":"2026-05-27T02:18:25.008874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dynamics-aware comparison of learned reward functions","venue":null,"work_id":"2b7b8481-0f54-4778-853f-bcac9346773f","year":2022},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:b4c4fed9bffcc2b2887cb72c8a2ce68403c06fb023c457c14bfa714021615271","observation_id":"91cb503f-62a6-4488-aa6a-22baec79bc27","resolution":{"observed_at":"2026-05-27T02:18:25.077423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-07-06T18:01:05.698046Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":"2404.10719","doi":"10.48550/arxiv.2404.10719","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study","venue":"arXiv (Cornell University)","work_id":"5ce8ff19-c68c-4255-bf4a-32ac6849467d","year":2024},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:880f961822a18a17f75d95de8bc5293192ef8a66788f08986936934b39ff001d","observation_id":"cf047b6a-c400-4d90-8d3d-0e3bfbe6ea2d","resolution":{"observed_at":"2026-05-11T23:41:19.562482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:2868d3612f4bdfb80912d31af43ad75723e516c5c0df3b61c221b167485ea9ca","observation_id":"f3fcb075-38e6-4eaf-b9b1-ee1850569394","resolution":{"observed_at":"2026-05-11T23:41:19.605231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:c4a9a0dbc6119689273ee66ce0f8681e6b330193dee3f275b539f08b91fa3a44","observation_id":"59af3c34-be70-43a5-9e92-5b9434de1e4d","resolution":{"observed_at":"2026-05-11T23:41:19.708864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On learning intrinsic rewards for policy gradient methods","venue":null,"work_id":"9019187c-f1c7-4a5b-998a-55902831adec","year":2018},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:10d776dd06d1a809055fc053913821aebd55b16b6fb8027c77fc6fdab683df92","observation_id":"f7c9d62b-ed80-410c-8034-fa70ad788a31","resolution":{"observed_at":"2026-05-27T02:18:25.024062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment","venue":null,"work_id":"b9cf4b70-bbf4-4c84-97ae-b88ac97bb410","year":2025},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:108729e37b2d86bc91dfa3b7e98479c546bbdc924ec46aded16c9964c4c32131","observation_id":"75db98d7-8b6b-4d13-8254-9d0ce84bccde","resolution":{"observed_at":"2026-05-27T02:18:25.087015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":"1909.08593","doi":"10.48550/arxiv.1909.08593","metadata_source":"pith","pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fine-Tuning Language Models from Human Preferences","venue":"cs.CL","work_id":"4f54aad1-f3b6-404f-b9c7-e21ba0a33b99","year":2019},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:a0aa65b3312da5493d2bdab44718c6b74ea4f72e071db458c29d01453c4a461d","observation_id":"86b2e17f-577a-4982-8958-8f23b466519c","resolution":{"observed_at":"2026-05-11T23:41:19.598253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T08:21:06.631932+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7390.7140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"partial rewards","venue":null,"work_id":"2c562d31-2a2e-4949-8f23-31062a55deca","year":1969},"citing_paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-07T16:24:43.688967Z"},"links":{"citing_paper":"/paper/2604.25872"},"observation_digest":"sha256:57daebabc20b34570333a8fee9f304cd72bc3130c81126ad11551d19a4554f7d","observation_id":"ae83b582-bad8-46ba-b797-a75062ed3730","resolution":{"observed_at":"2026-05-11T23:41:19.586625Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.25872","last_updated":"2026-04-28T17:10:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:10:15Z","title":"When Errors Can Be Beneficial: A Categorization of Imperfect Rewards for Policy Gradient"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":1,"verified_exact":27,"verified_fuzzy":69},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 1 inbound Pith citation observation for arXiv:2604.25872."}