{"as_of":"2026-08-13T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b80f81e95c89209234b7c828b5ddbad0b2c8dc0f8918329dd90103d010de758b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:10:44.092970Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:05:40.200096Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-12T21:10:44.092970Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09073","last_updated":"2025-07-09T05:40:56Z","snapshot_observed_at":"2026-08-13T01:03:50.043764Z","submitted_at":"2024-11-13T22:56:00Z","title":"CHAI for LLMs: Improving Code-Mixed Translation in Large Language Models through Reinforcement Learning with AI Feedback","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T21:10:44.092970Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2411.09073"},"observation_digest":"sha256:7d23dee3e48714376de843f3749d8628b66366008c2cab3d5f4abf11d1b2f8e5","observation_id":"4842cd52-f304-418a-b188-f2215cc35f9f","resolution":{"observed_at":"2026-08-12T21:10:44.092970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-10T11:53:55.424663Z","title":"Preventing reward hacking with occupancy measure regularization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-10T13:19:53.028871Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:53:55.424663Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2501.16629"},"observation_digest":"sha256:b0dcd765a06966bc2589515dd84163ae7ba91fa1cde65a1077a760d53ff434a4","observation_id":"d9fa1578-028d-400b-9587-c93bdb7b4e1e","resolution":{"observed_at":"2026-08-10T11:53:55.424663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-06T18:51:28.540210Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-09T22:55:04.253881Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.540210Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:b6b30a0303529aa5c6152149eb301a3dbca48574b0962715ef5ddd1524dc014e","observation_id":"2670194a-a4ac-4f5c-9ff8-66c87f5a78b3","resolution":{"observed_at":"2026-08-06T18:51:28.540210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-06T14:13:07.054604Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":206,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.054604Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:f6266a69f64dae8b09864653be806812d2d930facb47e1acc578aea94a6d8171","observation_id":"a2f7b982-d8b7-489f-a195-dd984d220137","resolution":{"observed_at":"2026-08-06T14:13:07.054604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-13T10:37:39.719847Z","title":", author Skalse, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04237","last_updated":"2026-04-05T19:43:29Z","snapshot_observed_at":"2026-07-13T10:37:33.912341Z","submitted_at":"2026-04-05T19:43:29Z","title":"Pedagogical Safety in Educational Reinforcement Learning: Formalizing and Detecting Reward Hacking in AI Tutoring Systems","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-13T10:37:39.719847Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.04237"},"observation_digest":"sha256:a5f6d752e0249c768c5699150224b2c89049df11f60ac226a1c1c818effcbc21","observation_id":"2fc8c0f6-865f-4505-82a2-67754d8d0c58","resolution":{"observed_at":"2026-07-13T10:37:39.719847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2604.07484","last_updated":"2026-04-20T15:02:36Z","snapshot_observed_at":"2026-08-11T05:07:03.172984Z","submitted_at":"2026-04-08T18:25:02Z","title":"ConsistRM: Improving Generative Reward Models via Consistency-Aware Self-Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:55.726473Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.07484"},"observation_digest":"sha256:237bdb9ef8903b5c384f3317956e8317291cd24bd513f85fe1df4ce4efe381f1","observation_id":"06d2ddd8-1325-45e9-89bb-dc941196c020","resolution":{"observed_at":"2026-05-11T05:20:57.524394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-07-31T19:56:49Z","snapshot_observed_at":"2026-08-12T17:31:55.767808Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T06:38:32.413172Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:c58809158842c74b42e974bbf882d6c926b87a3d1a83f3072ab193f5034e862b","observation_id":"52d9be29-3de1-4273-8d07-116dd9203852","resolution":{"observed_at":"2026-05-11T21:11:10.343291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-07-31T19:56:49Z","snapshot_observed_at":"2026-08-12T17:31:55.767808Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-01T09:56:48.019404Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:e68e90d2061e16287b311f904d1a27d44c27d9cc6e0ba26789856ca32c806ae6","observation_id":"96ff174c-932e-4786-99af-19862dfa8c28","resolution":{"observed_at":"2026-07-01T10:05:40.203539Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-04T05:25:40.960460Z","title":"Monte MacDiarmid, Benjamin Wright, Jonathan Ue- sato, Joe Benton, Jon Kutasov, Sara Price, Naia Bous- cal, Sam Bowman, Trenton Bricken, Alex Cloud, and 1 others","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.23488","last_updated":"2026-07-31T19:56:49Z","snapshot_observed_at":"2026-08-12T17:31:55.767808Z","submitted_at":"2026-04-26T01:26:50Z","title":"Do Prompt-Elicited Trajectories Reflect Training-Time Reward Hacking? A Systematic Study on Monitoring Training-Time Reward Hacking in Code Generation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T05:25:40.960460Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2604.23488"},"observation_digest":"sha256:9eb0a693a54c58f66a1b91ed9b804256294de640ccd32eaad03a0972af275d5f","observation_id":"c54b6007-68b2-4640-b5a6-73b3efa9d85b","resolution":{"observed_at":"2026-08-04T05:25:40.960460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-08-07T18:03:32.505412Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:ea4dac79547caa1f947310ed03c332e600f0e5527d4ce49b6b75da245f714522","observation_id":"9340113c-aa56-4a4b-8ee1-294f5aa71c62","resolution":{"observed_at":"2026-06-30T12:24:39.629009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T23:38:33.520625Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:ecdbcb7b2e5d9412c6bebc188097bffad55085ef9798a179d12a434cc7a6297e","observation_id":"1ab4c228-9c42-4b17-9b41-9cef9a2c692a","resolution":{"observed_at":"2026-06-28T23:42:49.591672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2605.30719","last_updated":"2026-06-26T17:52:03Z","snapshot_observed_at":"2026-07-06T23:39:58.378823Z","submitted_at":"2026-05-29T01:24:24Z","title":"When are LLMs Sufficient Policy Optimizers for Sequential RL Tasks?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T05:42:55.457904Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2605.30719"},"observation_digest":"sha256:b5e29768a94a89fb502a644f154e0e5b181629016f9309bbfd18b47432c9c2bc","observation_id":"e7eaca9b-a368-4663-9a76-c2e67284a7b7","resolution":{"observed_at":"2026-06-29T05:43:07.713266Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2606.30666","last_updated":"2026-06-18T10:25:09Z","snapshot_observed_at":"2026-08-13T09:08:49.898487Z","submitted_at":"2026-06-18T10:25:09Z","title":"Reframing AGI Confrontation with Off Earth Autonomy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-01T07:18:55.451342Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2606.30666"},"observation_digest":"sha256:e981b08a18e26b3ce4ea280782d2b84046f02b5aec71700006a11a55f4c7892e","observation_id":"b1ca5bd7-1be9-443c-9cc7-91332aac482f","resolution":{"observed_at":"2026-07-01T08:35:34.310983Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2403.03185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-13T04:38:43.998708Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:84d7d2ea309eef2bc79d082357431e802dd00a8d666ac64b75f3f4f241b962fc","observation_id":"8c85bc5c-0dc3-42ae-98d0-eac8dca4d909","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-08-10T21:10:19.761669Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06768","last_updated":"2026-08-07T03:41:58Z","snapshot_observed_at":"2026-08-13T13:29:13.166868Z","submitted_at":"2026-08-07T03:41:58Z","title":"Explore or Converge? Stage-Guided Per-Step Optimization for Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:10:19.761669Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2608.06768"},"observation_digest":"sha256:f352e5c517b201ea158e4580b5f34298ac360e905dc2739f48ffc11dc975a38c","observation_id":"51def8e8-b57b-4a8b-bbac-6f7c6bdffadd","resolution":{"observed_at":"2026-08-10T21:10:19.761669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.03185/citation-record","integrity":"/paper/2403.03185/integrity","json":"/paper/2403.03185/citation-record.json","paper":"/paper/2403.03185"},"outbound":[],"paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T18:22:39.215498Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2403.03185."}