{"as_of":"2026-08-19T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f52e66577540721be47cd49664a170cf1927a396ade472ab37aabf8184942dc","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:03:55.246559Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:51:52.262506Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:34:47.983586Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T10:53:00.347387Z","title":"Sahara Shrestha","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23330","last_updated":"2025-07-31T08:22:49Z","snapshot_observed_at":"2026-08-17T22:21:15.233600Z","submitted_at":"2025-07-31T08:22:49Z","title":"AI Must not be Fully Autonomous","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:00.347387Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2507.23330"},"observation_digest":"sha256:84cfa1dd5b736c7d0ab77ffca97518d7542a204859397855c21374ba9f36d115","observation_id":"37af238e-3c66-48b7-b8d8-4a01d16a4f31","resolution":{"observed_at":"2026-08-06T10:53:00.347387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-18T06:14:17.992551Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:1ffb378f7d41a43c81575b2103f15e94d6456a6ad55a42644152c5bf23e560ae","observation_id":"d02bf6ef-1025-4236-a04c-8720533ff381","resolution":{"observed_at":"2026-05-10T14:00:28.296337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.02964","last_updated":"2026-05-03T07:10:42Z","snapshot_observed_at":"2026-08-15T01:30:31.105334Z","submitted_at":"2026-05-03T07:10:42Z","title":"Reward Hacking Benchmark: Measuring Exploits in LLM Agents with Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T15:38:41.821264Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.02964"},"observation_digest":"sha256:7dd692a2b66075a3ca5022b053a0086daef0725c286184bf80e7e611fdc7d697","observation_id":"3b8e5177-58e3-46eb-a943-98ca9ca8c001","resolution":{"observed_at":"2026-05-11T10:06:03.602626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.24286","last_updated":"2026-05-22T23:37:29Z","snapshot_observed_at":"2026-08-12T18:44:44.174608Z","submitted_at":"2026-05-22T23:37:29Z","title":"Faithfulness as Information Flow: Evaluating and Training Faithful Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T15:29:34.096277Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.24286"},"observation_digest":"sha256:a08c67c44cfb6a327873e7a6141a581ffdffc3c0b41d262acd1977513cabb502","observation_id":"86df5f34-fae7-474a-989e-fb04c900df8c","resolution":{"observed_at":"2026-06-30T15:34:47.985017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-08-07T18:03:32.505412Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:ca43fe63286666697a1bdd2042b6c3e7a9303b9ce39963a9f9f1c0e9c78b1e3b","observation_id":"57d7f00b-157e-4cc2-a731-ce0ac2d98dd7","resolution":{"observed_at":"2026-06-30T12:24:39.625126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.207562Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.207562Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:13e1f7cb96b245967e888271edc358f0dc77b03db3c9ac7072096ff6ca95bbce","observation_id":"fc5cb71a-18b1-49eb-a2ec-5d8a375928a1","resolution":{"observed_at":"2026-08-06T17:51:52.207562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.262506Z","title":"arXiv preprint arXiv:2506.22777 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.262506Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:61e67445f6460ec5d0142efd53dec82d1a87dcbb7a3cfed35b608142257d6b7b","observation_id":"8daac443-4250-474f-8592-87fb3f5eef50","resolution":{"observed_at":"2026-08-06T17:51:52.262506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.22777/citation-record","integrity":"/paper/2506.22777/integrity","json":"/paper/2506.22777/citation-record.json","paper":"/paper/2506.22777"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.08574","last_updated":"2024-06-26T19:52:35Z","snapshot_observed_at":"2026-08-16T14:27:01.187248Z","submitted_at":"2024-01-16T18:58:37Z","title":"Deductive Closure Training of Language Models for Coherence, Accuracy, and Updatability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08574","snapshot_observed_at":"2026-08-06T22:03:50.441783Z","title":"F., Akyürek, E., Choshen, L., Wijaya, D., and Andreas, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.441783Z"},"links":{"cited_paper":"/paper/2401.08574","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:74c766c7b5f536be23821e5a825504c98e1764186a6354f2eeb97607be795c16","observation_id":"f21d7222-a4fa-4ed0-83a0-10f82d45ea24","resolution":{"observed_at":"2026-08-06T22:03:50.441783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.681184Z","title":"Claude 3.7 sonnet system card, 2025","venue":null,"work_id":"48c3d8ff-bb8a-4859-8d37-2efed249989c","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.497422Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:1422706a13b353a09d613eecc0a09e5b650fa73829542b40d8f9037fcc617671","observation_id":"ff74f8e3-c968-4801-8c60-1943027adc10","resolution":{"observed_at":"2026-08-06T22:04:01.747302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.504130Z","title":"System card: Claude opus 4 & claude sonnet 4, 2025","venue":null,"work_id":"bd31dc8b-9bbc-4b79-80ff-916af46a9960","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.661471Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:384b79784055e7ebe26b2843b87ca5472babca7c3a6aaaa31c9e20429f499ca2","observation_id":"302fb93a-fc55-4419-bffc-fe5132b7ef40","resolution":{"observed_at":"2026-08-06T22:04:01.576798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T22:03:50.831268Z","title":"Chain-of-thought reasoning in the wild is not always faithful.arXiv preprint arXiv:2503.08679, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.831268Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:821d1485e965975abc57375884bcc80ba7f80c7f58e1ad21b7d32b32d01e0bec","observation_id":"2ad3bb70-9718-4362-9b7b-5b5f34ad5512","resolution":{"observed_at":"2026-08-06T22:03:50.831268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.329326Z","title":"Do models say what they learn?, 2025","venue":null,"work_id":"d5e2f554-b6a8-4caa-ac70-dcf90043bef1","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:50.892798Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:45988cfd5d80613319f4e231ace355bc3c895eb255154b9658b392965e01b167","observation_id":"239f0235-1f8c-40fb-b310-915a321296d4","resolution":{"observed_at":"2026-08-06T22:04:01.427022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:01.110449Z","title":"CoT Red-Handed: Stress Testing Chain-of-Thought Monitoring, May 2025","venue":null,"work_id":"62b11bef-4c95-4c66-9663-b2de19adf736","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.084035Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:40360a71ddc31ae569d5b5b2c41b55fdc0e23dfb2c1a2bdf3a0f0babb9d37111","observation_id":"c841f2e4-0213-4768-924c-436d2805774b","resolution":{"observed_at":"2026-08-06T22:04:01.189283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T22:03:51.211271Z","title":"Y., Madry, A., Zaremba, W., Pachocki, J., and Farhi, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.211271Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:07d57c74b78c8e0fde07d50f29c574a8e905ffc315abbfbecca4dc679653ac13","observation_id":"a3b04bbd-4df7-4467-88d2-39c5d647e735","resolution":{"observed_at":"2026-08-06T22:03:51.211271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.933573Z","title":"C., Macar, U., Nanda, N., and Conmy, A","venue":null,"work_id":"70389d64-c08f-495d-b5b1-d40f844b0774","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.342380Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:e671eda6cd55e92c3c685fd1370c1ca82587c54bd3502cf59c9450a38e4e2b49","observation_id":"616b1434-3fc4-4f52-b899-1ce6c2dff02c","resolution":{"observed_at":"2026-08-06T22:04:00.996924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.03540","last_updated":"2022-11-11T20:17:18Z","snapshot_observed_at":"2026-07-06T14:15:17.474527Z","submitted_at":"2022-11-04T17:03:49Z","title":"Measuring Progress on Scalable Oversight for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.03540","snapshot_observed_at":"2026-08-06T22:03:51.583235Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.583235Z"},"links":{"cited_paper":"/paper/2211.03540","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:cbe050808c75bdf46e4e4b6960aaedff5b5f35cffd82fdf77964974302bb4a67","observation_id":"1bde6da0-f4f3-4a8c-9f28-1afffd67c247","resolution":{"observed_at":"2026-08-06T22:03:51.583235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08678","last_updated":"2023-07-17T17:41:47Z","snapshot_observed_at":"2026-08-19T03:58:18.418295Z","submitted_at":"2023-07-17T17:41:47Z","title":"Do Models Explain Themselves? Counterfactual Simulatability of Natural Language Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08678","snapshot_observed_at":"2026-08-06T22:03:51.721948Z","title":"Do models explain themselves? counterfactual simulatability of natural language explanations.arXiv preprint arXiv:2307.08678, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.721948Z"},"links":{"cited_paper":"/paper/2307.08678","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:617ab984c374f203f8977d4cf412249c601d41cc5e4652214cbf01dcde9a5513","observation_id":"54d38c93-7ef8-4d85-8794-6adf0cf2c45a","resolution":{"observed_at":"2026-08-06T22:03:51.721948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13986","last_updated":"2024-01-25T07:04:30Z","snapshot_observed_at":"2026-08-16T14:24:39.580436Z","submitted_at":"2024-01-25T07:04:30Z","title":"Towards Consistent Natural-Language Explanations via Explanation-Consistency Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13986","snapshot_observed_at":"2026-08-06T22:03:51.842152Z","title":"Towards consistent natural-language explanations via explanation-consistency finetuning.arXiv preprint arXiv:2401.13986, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.842152Z"},"links":{"cited_paper":"/paper/2401.13986","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:6840ded8f21c00cf2c6978be157f3a32b3ad021aa0055ef49b5f273f0148357f","observation_id":"34c38ac9-afcd-4cee-aaa6-c721edec54f4","resolution":{"observed_at":"2026-08-06T22:03:51.842152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T22:03:51.958119Z","title":"Reasoning models don’t always say what they think.arXiv preprint arXiv:2505.05410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.958119Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:100157eaf3619153000ac2b08cc0c7fe345c59990d9171bfa3a7ba08884eb25c","observation_id":"2170fee5-fc74-4209-a415-4a639f0c0b89","resolution":{"observed_at":"2026-08-06T22:03:51.958119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-14T16:34:08.653777Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T22:03:52.114166Z","title":"and Evans, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.114166Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:a74985a4ac4f26a17cfc962e302f3b26fd6265617daa85b708d9829a3615e162","observation_id":"dc59f3ac-4435-40e3-8787-ad58d3430371","resolution":{"observed_at":"2026-08-06T22:03:52.114166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05518","last_updated":"2025-06-26T19:29:49Z","snapshot_observed_at":"2026-08-16T14:11:31.512550Z","submitted_at":"2024-03-08T18:41:42Z","title":"Bias-Augmented Consistency Training Reduces Biased Reasoning in Chain-of-Thought","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05518","snapshot_observed_at":"2026-08-06T22:03:52.256909Z","title":"R., Michael, J., Perez, E., and Turpin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.256909Z"},"links":{"cited_paper":"/paper/2403.05518","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:cbec27cca620b7f204309d082b25393b7d72ef05b877cb5a74210f06e9ffa73e","observation_id":"246b518d-1ab1-4735-b78f-3311d85ac3f2","resolution":{"observed_at":"2026-08-06T22:03:52.256909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13206","last_updated":"2025-07-10T08:27:27Z","snapshot_observed_at":"2026-08-16T05:53:38.303108Z","submitted_at":"2025-06-16T08:10:04Z","title":"Thought Crime: Backdoors and Emergent Misalignment in Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13206","snapshot_observed_at":"2026-08-06T22:03:52.409376Z","title":"Thought crime: Backdoors and emergent misalignment in reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.409376Z"},"links":{"cited_paper":"/paper/2506.13206","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d2da61cd5a5502fd9d85a08e380961bb4e37eace2cc89c90387c563c30c98ea0","observation_id":"f6e3de66-b89d-45fb-87f8-5ed1d36b1be9","resolution":{"observed_at":"2026-08-06T22:03:52.409376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-08-18T14:49:13.384384Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-08-06T22:03:52.532834Z","title":"Sycophancy to subterfuge: Investigating reward-tampering in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.532834Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:44a8031a75d8ad578ca42f556d22bd8c40a4eaf2c242408df5f433e59555516a","observation_id":"e88a03ae-e068-4566-afa0-7d8f94d08bff","resolution":{"observed_at":"2026-08-06T22:03:52.532834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08608","last_updated":"2017-03-02T19:32:10Z","snapshot_observed_at":"2026-08-17T15:51:42.391912Z","submitted_at":"2017-02-28T02:19:20Z","title":"Towards A Rigorous Science of Interpretable Machine Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08608","snapshot_observed_at":"2026-08-06T22:03:52.662856Z","title":"and Kim, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.662856Z"},"links":{"cited_paper":"/paper/1702.08608","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:91d7e3664b92b026b33be9e5be31a879a36741f6d6ab020025af38afb8401736","observation_id":"fb9bf395-747d-4440-9fa5-1021e695b54d","resolution":{"observed_at":"2026-08-06T22:03:52.662856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13011","last_updated":"2025-04-10T16:25:31Z","snapshot_observed_at":"2026-08-17T02:54:37.934775Z","submitted_at":"2025-01-22T16:53:08Z","title":"MONA: Myopic Optimization with Non-myopic Approval Can Mitigate Multi-step Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13011","snapshot_observed_at":"2026-08-06T22:03:52.729172Z","title":"Mona: Myopic opti- mization with non-myopic approval can mitigate multi-step reward hacking.arXiv preprint arXiv:2501.13011, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.729172Z"},"links":{"cited_paper":"/paper/2501.13011","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:d3de4d940f56e4ee67c8f9ff04582d830645bcd96c2e7db3f316afe500fc26b4","observation_id":"cad4fade-f35b-4ddc-a36e-bd417372e751","resolution":{"observed_at":"2026-08-06T22:03:52.729172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:03:52.823979Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.823979Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:59399d1bd1a1cadb6d5f7975e38f0f0ec3ced283eceaa29bf6b35a86a3c717b0","observation_id":"682d30aa-73aa-499d-ba2c-27781aec2e4f","resolution":{"observed_at":"2026-08-06T22:03:52.823979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-08-13T11:12:58.507759Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-06T22:03:52.897092Z","title":"Alignment faking in large language models.arXiv preprint arXiv:2412.14093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:52.897092Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:671b69b52595a69a23d2ec4712f15ddfece0cbace54ff4493af4426536e0216c","observation_id":"476651c5-f936-451d-a94b-c1b54da0d379","resolution":{"observed_at":"2026-08-06T22:03:52.897092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01831","last_updated":"2020-05-04T20:35:17Z","snapshot_observed_at":"2026-08-10T18:16:36.996470Z","submitted_at":"2020-05-04T20:35:17Z","title":"Evaluating Explainable AI: Which Algorithmic Explanations Help Users Predict Model Behavior?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01831","snapshot_observed_at":"2026-08-06T22:03:53.060892Z","title":"and Bansal, M","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.060892Z"},"links":{"cited_paper":"/paper/2005.01831","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:fc3c6fc6ff68bb762489e055e026a74b56a9a1d7130affbf101e415ea2be47fa","observation_id":"d54daab9-5337-4536-bacc-7e43417a0aa8","resolution":{"observed_at":"2026-08-06T22:03:53.060892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.737014Z","title":"Measuring Massive Multitask Language Understanding","venue":null,"work_id":"61cd4243-185a-41b4-a1ce-66175b3618ab","year":2020},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.178068Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:415023fb9128c6c4c19422abebd23ad9540a345570452d64cf96083fd062c576","observation_id":"d1ba6d7d-cae9-410d-b8a7-40ee24609032","resolution":{"observed_at":"2026-08-06T22:04:00.831058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03685","last_updated":"2020-04-27T20:44:37Z","snapshot_observed_at":"2026-08-14T23:32:26.991996Z","submitted_at":"2020-04-07T20:15:28Z","title":"Towards Faithfully Interpretable NLP Systems: How should we define and evaluate faithfulness?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03685","snapshot_observed_at":"2026-08-06T22:03:53.317192Z","title":"and Goldberg, Y","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.317192Z"},"links":{"cited_paper":"/paper/2004.03685","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f2d1127204f3d5d7c393ce8959290137b79ed2075d0fd0f4a7b53c639fcf25d2","observation_id":"34491400-e581-485d-9654-5ade983b4683","resolution":{"observed_at":"2026-08-06T22:03:53.317192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T22:03:53.461451Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.461451Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:df0da9ea53b72b146c8cda7fccb261085c17206d83b1e2618d0c5d0abf7bddc4","observation_id":"e1f3071f-7371-4d66-b1ea-1d360ba676e1","resolution":{"observed_at":"2026-08-06T22:03:53.461451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13692","last_updated":"2024-08-01T17:18:54Z","snapshot_observed_at":"2026-08-18T23:52:17.487601Z","submitted_at":"2024-07-18T16:58:18Z","title":"Prover-Verifier Games improve legibility of LLM outputs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13692","snapshot_observed_at":"2026-08-06T22:03:53.640168Z","title":"H., Chen, Y., Edwards, H., Leike, J., McAleese, N., and Burda, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.640168Z"},"links":{"cited_paper":"/paper/2407.13692","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:e8700fe7f921852719768dbd6085f69a0116c705969a1543fa264104c712210f","observation_id":"dfcd6065-a185-47b4-a818-df84799aadc4","resolution":{"observed_at":"2026-08-06T22:03:53.640168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-06T22:03:53.828913Z","title":"Measuring faithfulness in chain-of-thought reasoning.arXiv preprint arXiv:2307.13702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.828913Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:4aa19d68fdd33859416722b36bbce25db81de581c405a707e95bdeebcfb53230","observation_id":"910bb57f-c351-4715-8196-5f40abf2c201","resolution":{"observed_at":"2026-08-06T22:03:53.828913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.568134Z","title":null,"venue":null,"work_id":"33cd7bf2-3af9-4bb8-ac24-a129769a5906","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:53.978883Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f83fa20e32a1d2dfac52de5d9c326a689e49b2c8c0c420a55bb89ad8d7494210","observation_id":"f87c9427-f11e-48c6-b9c4-899d25c0878f","resolution":{"observed_at":"2026-08-06T22:04:00.660472Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.315393Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":"79d26969-50c5-4aea-bf63-7e11a15888d6","year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.086785Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f12a8ebbc10c4eb11760184a570c38c15cf69e6b69b08652759e8a9c90ba86a8","observation_id":"81be3c40-872a-4346-a988-6ed51f211c33","resolution":{"observed_at":"2026-08-06T22:04:00.394410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-15T04:02:05.429942Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-06T22:03:54.197470Z","title":"Frontier models are capable of in-context scheming.arXiv preprint arXiv:2412.04984, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.197470Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:2901d6ca0658a3daa0de420f96a7c92c3218299f1aa56f57b9ae967cb6beb220","observation_id":"f3524604-2834-40fb-af44-93a9b9fd599f","resolution":{"observed_at":"2026-08-06T22:03:54.197470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11768","last_updated":"2023-07-25T04:01:43Z","snapshot_observed_at":"2026-08-16T15:15:50.660671Z","submitted_at":"2023-07-17T00:54:10Z","title":"Question Decomposition Improves the Faithfulness of Model-Generated Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.11768","snapshot_observed_at":"2026-08-06T22:03:54.287418Z","title":"Question decomposition improves the faithfulness of model-generated reasoning.arXiv preprint arXiv:2307.11768, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.287418Z"},"links":{"cited_paper":"/paper/2307.11768","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f3bbe7176a8dd08b74afe9f82b3a67bc9559c3a4b07882931a44c7c6f0b685ef","observation_id":"dbef506a-d2e8-4f1b-8ca0-42d10430c43e","resolution":{"observed_at":"2026-08-06T22:03:54.287418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18512","last_updated":"2023-10-31T19:13:43Z","snapshot_observed_at":"2026-08-16T14:48:07.623436Z","submitted_at":"2023-10-27T22:02:29Z","title":"Preventing Language Models From Hiding Their Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18512","snapshot_observed_at":"2026-08-06T22:03:54.383501Z","title":"and Greenblatt, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.383501Z"},"links":{"cited_paper":"/paper/2310.18512","citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:9c8115a96dcde8e3143cc8cc08e737ace80e659cd7deec0c6433465d0f6f6179","observation_id":"67be5f1f-89f9-49de-b9de-97969602ee1a","resolution":{"observed_at":"2026-08-06T22:03:54.383501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:04:00.107763Z","title":"J., and Radmard, P","venue":null,"work_id":"b4f17132-e467-45a8-94bd-0f7a446eba13","year":2025},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.445456Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:729d372b4e400826c8436e4d5cff6d9b73d932362720efe332582dea5764de09","observation_id":"9ffb1065-8644-47bb-8c77-fba73dfbe0ea","resolution":{"observed_at":"2026-08-06T22:04:00.213345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:59.931658Z","title":"Language models don’t always say what they think: Unfaithful explanations in chain-of-thought prompting.Advances in Neural Information Processing Systems, 36: 74952–74965, 2023","venue":null,"work_id":"36be4a95-f6d4-4ea3-85d7-b14b415cf960","year":2023},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.498071Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:135addf72566a80e68b7d6e55b41f6d997918d68fac632d64b84b6113686811d","observation_id":"191524fa-188c-4c1a-9e66-bdf657dc5058","resolution":{"observed_at":"2026-08-06T22:04:00.025428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:59.607146Z","title":"V ., and Zhou, D","venue":null,"work_id":"7633efe9-35cb-48f6-acc4-7d5320fa83b5","year":2022},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.613723Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:cfd63ba4e13a325321adc95f0e5779c6ab9a148d5acbc78edc1765d390229b85","observation_id":"365824e4-ee44-45c8-b5b5-2e03d6195ba9","resolution":{"observed_at":"2026-08-06T22:03:59.849231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:57.400139Z","title":"Stanford professor","venue":null,"work_id":"2e738b2c-0b93-4c32-ae1a-9db25a08b4d8","year":2024},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.726523Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:8202027fff6603e3bcf1bd1d9e6197699971c1d572a4fed9f752bdf032bb59ed","observation_id":"77a23d7b-eb7a-4ae6-a728-63ce0e16f3ee","resolution":{"observed_at":"2026-08-06T22:03:59.485553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:56.339289Z","title":null,"venue":null,"work_id":"4b716c94-e18b-46e9-a65e-a2769b1bcd9f","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.841726Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:f869e257c412cd45eb18773c80f1691d53991748dc448f14bfc246962b4ec0a4","observation_id":"c5a228f6-007e-4f2a-8cda-5db18b5855ff","resolution":{"observed_at":"2026-08-06T22:03:56.417600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:56.095896Z","title":null,"venue":null,"work_id":"935b87f2-66d8-4063-8c65-e460e536a9c5","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:54.998600Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:2949fc0bc3e2f9b953c9c579ec597adffeae59afeb76fd2dc89f3bcbf0b0c90e","observation_id":"44717e3c-8013-4a51-99d8-93bce8d1dc22","resolution":{"observed_at":"2026-08-06T22:03:56.224533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:55.920752Z","title":"In some cases the bias will be toward the correct answer so in some cases briefly con si de r if the biased answer seems p l a u s i b l e","venue":null,"work_id":"41dfe8fd-976b-4af9-8ed3-6661ba930399","year":2020},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:55.131494Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:102c750aaa04143a8715198a5de42579b61c64ccd13ce005f757d99a0030b5e5","observation_id":"3373f97b-cddf-4b46-851e-3e81004aa31b","resolution":{"observed_at":"2026-08-06T22:03:56.014356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:55.718027Z","title":"emotivism","venue":null,"work_id":"265b455d-4c79-48b8-ab47-ea4e5882e238","year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:55.246559Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:9e8f6167171742fd099a8d49d02805224d37bf8872918313e9aefd333cd57ef7","observation_id":"b6f3221a-d240-4ea6-a402-1de50dfb289e","resolution":{"observed_at":"2026-08-06T22:03:55.825385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:03:51.437235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:03:51.437235Z"},"links":{"citing_paper":"/paper/2506.22777"},"observation_digest":"sha256:63a0bd7a1ddcdd4356a5c5c5d9399a39039f4aa09d81f8a3a6f2867062d6cc29","observation_id":"8f19acc5-3cfa-4e71-be6a-08e0adfc46c6","resolution":{"observed_at":"2026-08-06T22:03:51.437235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 7 inbound Pith citation observations for arXiv:2506.22777."}