{"as_of":"2026-08-19T02:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f75fb653619651c604e94a388a03f0942fb74da31d27c826b709608f0f7f7b39","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:51:52.279090Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04735/citation-record","integrity":"/paper/2608.04735/integrity","json":"/paper/2608.04735/citation-record.json","paper":"/paper/2608.04735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.982565Z","title":"Inspect AI : Framework for large language model evaluations, May 2024","venue":null,"work_id":"e332a86b-2dfc-47b9-a6c6-2c38af1eb640","year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.828961Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:df8340d5300aad33bcab48b7cd59c07ef5f649eb10251f594c4b32ac4f164556","observation_id":"7847c1fd-240f-4c1b-8b72-b44e8ba17873","resolution":{"observed_at":"2026-08-06T17:51:57.025625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.680797Z","title":"Introducing Claude haiku 4.5, October 2025 a","venue":null,"work_id":"a678ba3d-3bcd-4416-bac9-0af4595b37c2","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.876010Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:3f4e56b28433951a0f14769a8d31f564513787708f78ec7728ed5fecb4cbb016","observation_id":"d2be7f1d-5e18-467f-9912-e82813a20e15","resolution":{"observed_at":"2026-08-06T17:51:56.835810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.340030Z","title":"Introducing Claude opus 4.5, November 2025 b","venue":null,"work_id":"c5cf0568-08ba-4783-9292-0cefe9c2b218","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.923038Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:328a754642cb2403938f3ed4eb266504dfe3bead6323e693318ec8ece18f6cf5","observation_id":"e95b416b-de1e-4fd8-92ee-637b4e2811a0","resolution":{"observed_at":"2026-08-06T17:51:56.491211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:56.126265Z","title":"Introducing Claude sonnet 4.5, September 2025 c","venue":null,"work_id":"5d30b02a-a5a1-4ad9-833b-bf90d5674b29","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:50.968522Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a381177d0d873d3f77f0749bde8240a9a6c1fd04f60f8c1867bd1d89d129567c","observation_id":"1a90898a-bc18-40f9-8b9a-f0032c091536","resolution":{"observed_at":"2026-08-06T17:51:56.238274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08679","last_updated":"2026-06-16T17:36:22Z","snapshot_observed_at":"2026-08-16T12:51:00.810519Z","submitted_at":"2025-03-11T17:56:30Z","title":"Chain-of-Thought Reasoning In The Wild Is Not Always Faithful","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08679","snapshot_observed_at":"2026-08-06T17:51:51.013543Z","title":"Chain-of-thought reasoning in the wild is not always faithful, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.013543Z"},"links":{"cited_paper":"/paper/2503.08679","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:f3dfc75ebf00a339dbd0f0cbce05d809e739cf086b096ebe69a1ce6e193c65c0","observation_id":"96f401f5-f452-466e-8c89-fc3e111287e3","resolution":{"observed_at":"2026-08-06T17:51:51.013543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.10117","last_updated":"2026-05-29T17:54:32Z","snapshot_observed_at":"2026-08-15T03:19:19.397194Z","submitted_at":"2026-02-10T18:59:56Z","title":"Biases in the Blind Spot: Detecting What LLMs Fail to Mention","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.10117","snapshot_observed_at":"2026-08-06T17:51:51.079079Z","title":"Biases in the blind spot: Detecting what llms fail to mention, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.079079Z"},"links":{"cited_paper":"/paper/2602.10117","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:83401078afae3ee7baf273108022e808cf94b732c33491552773b590475a53c3","observation_id":"366a74fc-0792-4b39-b5c3-c60280eb4461","resolution":{"observed_at":"2026-08-06T17:51:51.079079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2601.21112","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"How does information access affect LLM monitors' ability to detect sabotage? arXiv preprint arXiv:2601.21112, January 2026","venue":"Open MIND","work_id":"354d629c-dab1-465c-9105-4dd2f23cad6e","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.133048Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:2c89f3eeb109a1bf43477f07d0b3348c9d4f2ce20b7d46f2d0d4035ec2b17cc8","observation_id":"3b791013-7f29-4d0b-888a-19e074ff7dea","resolution":{"observed_at":"2026-08-06T17:51:52.773964Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.23575","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"CoT red-handed: Stress testing chain-of-thought monitoring","venue":"ArXiv.org","work_id":"c3adb2bb-4c1b-4a2f-91a0-142c164418d1","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.189440Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:c0fc3ab3c0daeabf269ac686bdd98e12861beb876a669a9ee61c66bffdb4b1bd","observation_id":"e411a152-ded3-44c0-bd5f-77beed122afc","resolution":{"observed_at":"2026-08-06T17:51:52.696529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T17:51:51.240956Z","title":"Guan, Aleksander Madry, Wojciech Zaremba, Jakub Pachocki, and David Farhi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.240956Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:1686af7861d046886499d2eb220b3d1695fea25ae40e727d8dcb4948a5c4f7d3","observation_id":"0aa7a58c-ad9e-47a7-99cb-42408b2e00b0","resolution":{"observed_at":"2026-08-06T17:51:51.240956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14345","last_updated":"2026-08-14T19:35:34Z","snapshot_observed_at":"2026-08-19T02:13:20.092583Z","submitted_at":"2026-07-15T20:19:17Z","title":"Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values","version":4},"cited_work":{"arxiv_id":"2607.14345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.14345","snapshot_observed_at":"2026-08-06T17:51:53.490596Z","title":"Value Leakage: An LLM's Answers Are Silently Shaped by Its Own Values","venue":"cs.LG","work_id":"7e7396a9-268f-4bd2-8226-646dcd45a7d4","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.301008Z"},"links":{"cited_paper":"/paper/2607.14345","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:1abde87f05233f913f150c5ef82ea6bca3b6dc0bad09bf8a499327580d467f3e","observation_id":"791437e5-9cf6-41f3-beb7-14463f28461b","resolution":{"observed_at":"2026-08-06T17:51:53.503854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.05494","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Censored LLMs as a natural testbed for secret knowledge elicitation","venue":"Open MIND","work_id":"81fc9f3a-2824-44eb-9e2d-2d3971de1c55","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.364168Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:5b8b09b35d11f00ade26c20cf177b6cf75bb3a1866f002789ec90e55560d536a","observation_id":"ee052de4-fd50-4743-b7dc-1918bc7d93d5","resolution":{"observed_at":"2026-08-06T17:51:52.622765Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T17:51:51.482929Z","title":"Bowman, Jan Leike, Jared Kaplan, and Ethan Perez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.482929Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9bfc0bb8e1c3d103a5a13d2b25f622204451983c7b00ed95930b34bdb69cdfae","observation_id":"a1af007d-4c82-4494-8810-dfe623e17938","resolution":{"observed_at":"2026-08-06T17:51:51.482929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2603.05706","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Lee, He He, Ian Kivlichan, Bowen Baker, Micah Carroll, and Tomek Korbak","venue":"Open MIND","work_id":"d84a089e-6ffc-4625-b5ac-f9c74309e96f","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.556485Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:f72de47f8a7c1403a2494a269dfe77941c149b034ce805a16cccfb9546c48242","observation_id":"31bd8a52-def3-4980-b486-f4912b8a29b7","resolution":{"observed_at":"2026-08-06T17:51:52.542529Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-14T16:34:08.653777Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T17:51:51.627288Z","title":"Are deepseek r1 and other reasoning models more faithful? arXiv preprint arXiv:2501.08156, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.627288Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:8c5eb591991bfe546672655852f3ab29f1714a24dc8ee8b3b147849c4f1ff971","observation_id":"e5e97ee0-eae1-4eb5-b90e-08d1df8d9865","resolution":{"observed_at":"2026-08-06T17:51:51.627288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05246","last_updated":"2025-07-07T17:54:52Z","snapshot_observed_at":"2026-08-14T01:04:51.496033Z","submitted_at":"2025-07-07T17:54:52Z","title":"When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05246","snapshot_observed_at":"2026-08-06T17:51:51.719517Z","title":"Elson, Rif A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.719517Z"},"links":{"cited_paper":"/paper/2507.05246","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:c54f03eeb0e028b22956735959ebd0ec788a9c360052781616c4c442fdde2f27","observation_id":"f3d8dc31-19d1-4cda-9ead-c45b620d98b6","resolution":{"observed_at":"2026-08-06T17:51:51.719517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.882905Z","title":"(some) natural emergent misalignment from reward hacking in non-production rl, March 2026","venue":null,"work_id":"0dac7a51-ef69-45b0-b512-e55001c269e7","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.834128Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:d2b885c6be8de706a98215e809735fd8cb6b7b9d2f820b69a2bf0573be0fb25f","observation_id":"e76d3e12-a314-4abe-94a4-1407cb4be026","resolution":{"observed_at":"2026-08-06T17:51:56.031994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2512.18311","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Guan, Miles Wang, Micah Carroll, Zehao Dou, Annie Y","venue":"arXiv (Cornell University)","work_id":"f747703b-7b62-4c68-8036-918ae7264e15","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:51.946000Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:30ee77714d92bfe1455a6966aac076c1c1893c683dc48279588073bf9663b259","observation_id":"d3aea62b-7a06-4803-9dad-47dc30961199","resolution":{"observed_at":"2026-08-06T17:51:52.467492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-15T10:50:02.37991+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T10:50:02.37991+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.058436Z","title":"Noticing the watcher: LLM agents can infer CoT monitoring from blocking feedback","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.058436Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9a53155310f9f8a165508cca76c38608ddeff166828c4395c8d35458edeba9ae","observation_id":"8cb673e0-48bc-460e-b3d1-bed4380fa23f","resolution":{"observed_at":"2026-08-06T17:51:52.058436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-17T02:01:42.843839Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-06T17:51:52.127591Z","title":"Chain of thought monitorability: A new and fragile opportunity for ai safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.127591Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:76977c9103f6768d11ff655afb5f437c7458804d714eed050432db60566182a7","observation_id":"3e760a5c-06ea-4874-9859-3c1560cfed5b","resolution":{"observed_at":"2026-08-06T17:51:52.127591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15740","last_updated":"2025-07-08T21:23:22Z","snapshot_observed_at":"2026-08-17T23:40:36.693819Z","submitted_at":"2025-06-17T15:46:15Z","title":"SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15740","snapshot_observed_at":"2026-08-06T17:51:52.183344Z","title":"SHADE -arena: Evaluating sabotage and monitoring in LLM agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.183344Z"},"links":{"cited_paper":"/paper/2506.15740","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:9906e5db1c438a255a9ce44c51028eddd63041eb0fa30b876b794d7fe3360fd0","observation_id":"22c44c1e-22f5-4d04-b6fd-fce58ce9fa4f","resolution":{"observed_at":"2026-08-06T17:51:52.183344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-08-13T18:02:27.155379Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-06T17:51:52.186621Z","title":"Bowman, and Ethan Perez","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.186621Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:5e7c1193429dba3181d129948087304b757ae48015711dcd10586eb9fac54fa5","observation_id":"1876190b-3bb6-4f5d-8e47-bda706cf4f6a","resolution":{"observed_at":"2026-08-06T17:51:52.186621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.188944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.188944Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:44b4aa03d66ffb4d68f74e04b884bdf8956331dc454f5de3349108d47fc37cd5","observation_id":"1c2634c9-8748-435f-89fc-1556adf7a8e6","resolution":{"observed_at":"2026-08-06T17:51:52.188944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.623894Z","title":"Kimi k2 thinking, January 2026","venue":null,"work_id":"8930a8d7-7c8c-40c5-83ac-4c7789c64bcc","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.191108Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:3d1b73b16a6071e41772719ac694e3da4e6ec41bce2e787414b73d2def50be5c","observation_id":"3651c42c-9b21-436c-ab27-1bab369e683f","resolution":{"observed_at":"2026-08-06T17:51:55.762764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.341490Z","title":"gpt-oss-120b and gpt-oss-20b model card, August 2025","venue":null,"work_id":"5bd974bc-e313-4754-8160-d753c338cfc6","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.193355Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:2bc768c60f0ea41f215412488b7cac2484bebeb14f7752664e251c379479ba3f","observation_id":"4760181c-3f11-4e6a-8253-4d579d9e9421","resolution":{"observed_at":"2026-08-06T17:51:55.503751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06681","last_updated":"2024-07-05T15:30:45Z","snapshot_observed_at":"2026-08-15T08:04:06.283165Z","submitted_at":"2023-12-09T04:40:46Z","title":"Steering Llama 2 via Contrastive Activation Addition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06681","snapshot_observed_at":"2026-08-06T17:51:52.195387Z","title":"Steering Llama 2 via contrastive activation addition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.195387Z"},"links":{"cited_paper":"/paper/2312.06681","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:de3ea7fb32ae6c0f8c01792800f907078e8bd6760985c0fc422bd0c721df2ee5","observation_id":"d17cf599-3150-4a5b-8cc7-14591bd740eb","resolution":{"observed_at":"2026-08-06T17:51:52.195387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.200090Z","title":"Large language models can learn and generalize steganographic chain-of-thought under process supervision, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.200090Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:02dc43b66561f6fed950d9588f1399c1659f3b77335d0f46fe6fa31308e5ae6c","observation_id":"4269579b-a6a1-498b-8a71-ec6210044950","resolution":{"observed_at":"2026-08-06T17:51:52.200090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T17:51:52.202208Z","title":"Vazquez, Ulisse Mini, and Monte MacDiarmid","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.202208Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:62627181c7c3ebb1ebb028cb526a867ec4ec79d47585ae4312c01f0df690905c","observation_id":"d19fe64f-252a-44d0-be19-488d429369ef","resolution":{"observed_at":"2026-08-06T17:51:52.202208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04388","last_updated":"2023-12-09T21:25:02Z","snapshot_observed_at":"2026-08-12T21:03:44.597326Z","submitted_at":"2023-05-07T22:44:25Z","title":"Language Models Don't Always Say What They Think: Unfaithful Explanations in Chain-of-Thought Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04388","snapshot_observed_at":"2026-08-06T17:51:52.204689Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.204689Z"},"links":{"cited_paper":"/paper/2305.04388","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:84fde04858b8ff2f51e20df856740de928f7bb71826a8be0f0d495ed6578983c","observation_id":"1e354193-0b20-4880-bdd3-940b439a681b","resolution":{"observed_at":"2026-08-06T17:51:52.204689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.207562Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.207562Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:13e1f7cb96b245967e888271edc358f0dc77b03db3c9ac7072096ff6ca95bbce","observation_id":"fc5cb71a-18b1-49eb-a2ec-5d8a375928a1","resolution":{"observed_at":"2026-08-06T17:51:52.207562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-17T13:17:07.963143Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T17:51:52.209806Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.209806Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:4dd71e57649632dc2d4729e5ae69181a98b985eb827bae633dd025e3af7fedf1","observation_id":"d43bd6ce-84b7-4f2f-b8b1-aa28a045cfa8","resolution":{"observed_at":"2026-08-06T17:51:52.209806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:55.093652Z","title":"Grok 3 beta --- the age of reasoning agents, February 2025","venue":null,"work_id":"3f3564af-1ec9-48c0-800d-6d4cf231b359","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.212330Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:60e293af2cf9d9d95cfd0f8e3af6eaef5bc98672d1c832143c5a13f4bc8a6b5f","observation_id":"e8b455d8-8d05-46f3-859c-f38727e2e722","resolution":{"observed_at":"2026-08-06T17:51:55.227558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.877697Z","title":"GLM -4.7: Advancing the coding capability, December 2025","venue":null,"work_id":"f52c2890-72f2-4311-85f4-94f3d7e88a90","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.214472Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:c9628435d55b56fe28abe167702e2b7475022170dac6ece372c87d1ab43108f5","observation_id":"54fed9a0-8407-4395-ae8a-33038bcb0cfd","resolution":{"observed_at":"2026-08-06T17:51:54.965790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.216459Z","title":"Can reasoning models obfuscate reasoning? stress-testing chain-of-thought monitorability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.216459Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:eeec532c6e964f47284afd1e00b487399b34cbfc0f3398b79a602a5da0166c89","observation_id":"13fb16fc-05d5-414c-8ed0-4e4729999ed4","resolution":{"observed_at":"2026-08-06T17:51:52.216459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.218672Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.218672Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:289ac41a358df58e0814ea8c7e0b615a58544818faa6ac1664e2b1c109c58d0c","observation_id":"2437502c-1a34-4113-ae1e-bba68ec7ea31","resolution":{"observed_at":"2026-08-06T17:51:52.218672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.220659Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.220659Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b1aeb548848ea60b16b2e1db3063dfb1d30c89de0c3ad76c0d228afd5e78624e","observation_id":"927958a4-176c-4630-b2be-86610271f78c","resolution":{"observed_at":"2026-08-06T17:51:52.220659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.222703Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.222703Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:edae68e926df5d25ebdaf59e466989d25f53ecefd8e5597c4fb7e9f14aa765c6","observation_id":"98c666c8-bd05-4431-8064-c1bb5dc17370","resolution":{"observed_at":"2026-08-06T17:51:52.222703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.712907Z","title":"2026 , eprint=","venue":null,"work_id":"d531e3d0-4069-4cf0-85af-ea9dd520411f","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.224969Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:88f4b1fda4e741c0253bccc9ad4c2af7635959267025241addbd6957491957db","observation_id":"4f9459d3-121b-4223-a87d-8015784b7ea4","resolution":{"observed_at":"2026-08-06T17:51:54.777138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.634460Z","title":"2025 , eprint=","venue":null,"work_id":"99878e91-a411-426f-8f54-aabe4aea3f0a","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.226927Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b32ce5f5199a0ef64b4a80cd6b2707868009186ab4535adc12b0c761cd4131ca","observation_id":"5178187b-cf63-4f2c-8935-92370c368a2d","resolution":{"observed_at":"2026-08-06T17:51:54.665282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.480986Z","title":"2026 , eprint=","venue":null,"work_id":"447e8bb7-11fd-4548-9f74-6b9e2c8cce1e","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.228836Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b1449dd19e1226356b9ba0e78e363001393b8f5d196992ef17f45ebeee39cdca","observation_id":"c9b6f91c-e608-4553-900d-9d7171c2293c","resolution":{"observed_at":"2026-08-06T17:51:54.582474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.230732Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.230732Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:c5fe5f34200dc82d33d5b829dfc4bcdc6cc65cc6f1e38b3822be2c8ec3ad464c","observation_id":"8a77ec12-81e6-421d-95ab-c5a11106bdca","resolution":{"observed_at":"2026-08-06T17:51:52.230732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.232686Z","title":"arXiv preprint arXiv:2512.18311 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.232686Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:323ec38c15932a9607e0697d8721b627667384edffeff9a25096fdd491b72c32","observation_id":"2216db55-6d18-447f-abcf-399d79cf8587","resolution":{"observed_at":"2026-08-06T17:51:52.232686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-08-17T15:42:03.133713Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-06T17:51:52.234780Z","title":"arXiv preprint arXiv:2503.11926 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.234780Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:253a9694acbc78e0a2f98833f4bbd6f02d132a89cfcc68214c51400d0e660a5b","observation_id":"f2441273-de61-4d74-98c2-3bd6b0405e43","resolution":{"observed_at":"2026-08-06T17:51:52.234780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.236856Z","title":"arXiv preprint arXiv:2603.05706 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.236856Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:36429c639d80e4186a151ccc119845221f69bcf6329fa7f0a247f7a43799fb76","observation_id":"03053e1a-46ae-4826-8f62-66d4aa37aeb3","resolution":{"observed_at":"2026-08-06T17:51:52.236856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.238875Z","title":"arXiv preprint arXiv:2510.19851 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.238875Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:48019b9457eebfb9f9d71a11f9feff674681886740e589fa96c1659a5bad9e0e","observation_id":"73fad7a8-57a9-467f-9bc2-e574c9639c7a","resolution":{"observed_at":"2026-08-06T17:51:52.238875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.241151Z","title":"arXiv preprint arXiv:2505.23575 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.241151Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:b09d62aa6ab67243e1cad72ec0ccd15ca4cbc51c91bae7907852d428d0e55ed2","observation_id":"d596953b-7e25-450b-b47c-9a8a9b4bc214","resolution":{"observed_at":"2026-08-06T17:51:52.241151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05246","last_updated":"2025-07-07T17:54:52Z","snapshot_observed_at":"2026-08-14T01:04:51.496033Z","submitted_at":"2025-07-07T17:54:52Z","title":"When Chain of Thought is Necessary, Language Models Struggle to Evade Monitors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05246","snapshot_observed_at":"2026-08-06T17:51:52.243168Z","title":"arXiv preprint arXiv:2507.05246 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.243168Z"},"links":{"cited_paper":"/paper/2507.05246","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:675c14a87df1de1a82fac1dd8e1e5e1cc11d356fd3162d495f753a186b591bb6","observation_id":"b9bf8812-08ae-4748-befb-961011b835f5","resolution":{"observed_at":"2026-08-06T17:51:52.243168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.289850Z","title":"Noticing the Watcher:","venue":null,"work_id":"71c8da57-13de-4028-b86e-8f6f352e7b6a","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.245734Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:e6ec026aa249251f7e690a3db308a5cca32f3ff93cea23d821283a7627d6f0e2","observation_id":"b8b8928b-266a-431f-8ecc-d9792f291cf1","resolution":{"observed_at":"2026-08-06T17:51:54.381037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15740","last_updated":"2025-07-08T21:23:22Z","snapshot_observed_at":"2026-08-17T23:40:36.693819Z","submitted_at":"2025-06-17T15:46:15Z","title":"SHADE-Arena: Evaluating Sabotage and Monitoring in LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15740","snapshot_observed_at":"2026-08-06T17:51:52.248062Z","title":"arXiv preprint arXiv:2506.15740 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.248062Z"},"links":{"cited_paper":"/paper/2506.15740","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:1c0ca32b05afdc5ee05c8386b8f779305a31286e4377cec4459e5571bac7f351","observation_id":"f77f12fa-2906-4938-afa5-a16bcb1a9463","resolution":{"observed_at":"2026-08-06T17:51:52.248062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.250176Z","title":"How does information access affect","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.250176Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:203f2eb8bc3b331a9d90ffe8684bd1aa779bb34b2c84d93ed4af5fdc82323054","observation_id":"9aedb683-1bd7-40c5-815c-4ffddab805dd","resolution":{"observed_at":"2026-08-06T17:51:52.250176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.251993Z","title":"Censored","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.251993Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a94cc646d70e667c4f4b4684849bee7f7927015b45aee10637132d09dd895d19","observation_id":"9f4c68f4-055c-4a3b-a21e-2af33c9e81f9","resolution":{"observed_at":"2026-08-06T17:51:52.251993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:54.159320Z","title":"Steering","venue":null,"work_id":"e717f6be-826d-4ead-8363-cc426a38e049","year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.253855Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:89737e4783c87b29620c21098faa0a139a8093df96e96b16580b441b558577ca","observation_id":"8866e0b7-52c9-4da1-818d-d74a206bfd76","resolution":{"observed_at":"2026-08-06T17:51:54.249447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-06T17:51:52.255930Z","title":"arXiv preprint arXiv:2308.10248 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.255930Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:bff987baecf0349d6f92cc29028f2745b240c070cb063b1a4730e5b7f16a6c86","observation_id":"1bde4f1c-47e6-4640-b119-782c5d80421e","resolution":{"observed_at":"2026-08-06T17:51:52.255930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08156","last_updated":"2025-07-15T17:27:07Z","snapshot_observed_at":"2026-08-14T16:34:08.653777Z","submitted_at":"2025-01-14T14:31:45Z","title":"Are DeepSeek R1 And Other Reasoning Models More Faithful?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08156","snapshot_observed_at":"2026-08-06T17:51:52.258144Z","title":"arXiv preprint arXiv:2501.08156 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.258144Z"},"links":{"cited_paper":"/paper/2501.08156","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:e784739b8942408c60f262e6b20a925cc1bd003bfa8fad01e08a6bc083649eaa","observation_id":"47e18b2a-f703-4c80-9d3f-be93e2d71ed6","resolution":{"observed_at":"2026-08-06T17:51:52.258144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-06T17:51:52.260226Z","title":"arXiv preprint arXiv:2505.05410 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.260226Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:dd178d1fe78b14b293a917bd65501a868bf4afe7e6a4283c4e315b89420d878d","observation_id":"27e34088-3de7-4aec-a62c-7553b5bb1345","resolution":{"observed_at":"2026-08-06T17:51:52.260226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-08-17T01:23:04.052232Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-08-06T17:51:52.262506Z","title":"arXiv preprint arXiv:2506.22777 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.262506Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:61e67445f6460ec5d0142efd53dec82d1a87dcbb7a3cfed35b608142257d6b7b","observation_id":"8daac443-4250-474f-8592-87fb3f5eef50","resolution":{"observed_at":"2026-08-06T17:51:52.262506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.937212Z","title":"2026 , month=","venue":null,"work_id":"faff0bf6-80f3-4c87-923a-851bdf1ab58c","year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.264644Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:20d4be0d808894d6981c35a5148df8383c9493e8b10cf139778b89a7162627c3","observation_id":"10dc86da-4f31-49dd-89d6-1d84367a99da","resolution":{"observed_at":"2026-08-06T17:51:54.034479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.706046Z","title":"2025 , eprint=","venue":null,"work_id":"e2dc3f38-1cd9-410b-97a8-e9e6fd666f8a","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.266564Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:e4f498127e45556453489c325d9061b90d47698fed38b04331eaf559a2babbaf","observation_id":"0370dbc7-3f1a-4713-a0a5-382c4d7f45b6","resolution":{"observed_at":"2026-08-06T17:51:53.801715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:53.535861Z","title":"2025 , eprint=","venue":null,"work_id":"46e39faa-d399-4b89-a0ba-343f7a0c7605","year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.268522Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:fdf62fe95ab7e3f9680633f02f2b00c4613f0fbb2e3c1d19c71e0e63ccb547ae","observation_id":"10862a44-87c1-49bd-a152-b497a20cabab","resolution":{"observed_at":"2026-08-06T17:51:53.612616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-06T17:51:52.270575Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.270575Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:a4c548da9d8d91c23614a3915d4a44e5e14d104bb77110f989cae5d5bc7ef71d","observation_id":"ff7822dc-7acd-4f27-a4e3-83cd1b74624f","resolution":{"observed_at":"2026-08-06T17:51:52.270575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.272644Z","title":"2025 , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.272644Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:8ef3468f511bac4880782fda4faab3ca91a75bfc0a1094a6330f12ab90209a18","observation_id":"f68615f0-7475-41bb-8659-4c087ba4a378","resolution":{"observed_at":"2026-08-06T17:51:52.272644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.274605Z","title":"2024 , month =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.274605Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:74aabda52d6df74a1fcf7f43671e2e50fb05f7a58abf713180911982cb8f1612","observation_id":"8e3d9c8b-8daf-4730-91e2-6918e9a77e7c","resolution":{"observed_at":"2026-08-06T17:51:52.274605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-18T14:12:03.598270Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T17:51:52.276967Z","title":"Bowman , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.276967Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:6722f421c0216f1451ebc128fd7176ed7d6625077da14c376bba1ad7225f32d0","observation_id":"5a939a46-89a1-43c6-a786-78eb546c2959","resolution":{"observed_at":"2026-08-06T17:51:52.276967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:51:52.279090Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T17:51:52.279090Z"},"links":{"citing_paper":"/paper/2608.04735"},"observation_digest":"sha256:e62de0e2cc9ebe700a17ae3bcbbb9d93dbfb868fd8801cec66948884a68bab02","observation_id":"7975a77d-4bac-4655-b354-d47530af65b9","resolution":{"observed_at":"2026-08-06T17:51:52.279090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.04735","last_updated":"2026-08-05T11:59:20Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T12:54:52.315175Z","submitted_at":"2026-08-05T11:59:20Z","title":"Chain-of-Thought Monitoring Can Be Unreliable in Implicit-Influence Settings"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":6,"verified_fuzzy":17},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2608.04735."}