{"as_of":"2026-08-14T08:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6412da17ba351719698a5314de218db08b626705ce91a9a4f8f5cce89b7629f6","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:33.763079Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:56:07.082215Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:37:37.332332Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2509.26238","last_updated":"2026-04-21T11:04:39Z","snapshot_observed_at":"2026-08-13T23:08:30.114748Z","submitted_at":"2025-09-30T13:32:59Z","title":"Beyond Linear Probes: Dynamic Safety Monitoring for Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-18T12:41:48.620040Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2509.26238"},"observation_digest":"sha256:6d179c57bff4e4b19cb8ed79633c488794f416d38e12bd27d88c811413f81910","observation_id":"ffe7e012-7818-4a65-af1a-76856157ffe7","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-08-13T12:59:15.970811Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:45:13.320426Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:6baaa8f8d240d4d62b2e27034f6fd56fc39a532d8f9cb7c14ab5dc4f6b251d7b","observation_id":"6abccfcf-ec33-4be3-9721-92104184f470","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":"2505.14300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-07-13T00:17:01.038763Z","title":"Safetynet: Detecting harmful outputs in llms by modeling and monitoring deceptive behaviors","venue":null,"work_id":"2f5a2632-7f9b-43fc-a5c5-2e816a914430","year":2025},"citing_paper":{"arxiv_id":"2606.11270","last_updated":"2026-06-26T21:36:00Z","snapshot_observed_at":"2026-08-13T12:59:15.970811Z","submitted_at":"2026-06-09T06:52:49Z","title":"Quantifying Subliminal Behavioral Transfer Ratios in Language Model Distillation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T11:15:21.946819Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2606.11270"},"observation_digest":"sha256:752711115842c3c62f48fc79b40952d61ee78ab639265f8ce2c1483f38bcf21e","observation_id":"7a9b3364-da71-4aba-8598-302f7bfb565e","resolution":{"observed_at":"2026-07-13T00:17:01.038763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14300","snapshot_observed_at":"2026-08-02T11:56:07.082215Z","title":"arXiv preprint arXiv:2505.14300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24769","last_updated":"2026-06-09T06:02:50Z","snapshot_observed_at":"2026-08-13T14:58:02.585858Z","submitted_at":"2026-06-09T06:02:50Z","title":"LLM Scheming Inversely Scales with Pretraining Language Coverage","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T11:56:07.082215Z"},"links":{"cited_paper":"/paper/2505.14300","citing_paper":"/paper/2607.24769"},"observation_digest":"sha256:17ce6d015f691cb5e4b65588455825466d91eec8fcd4823ab6130f575fe1b827","observation_id":"41c58c6d-6c29-4331-ac13-93a62484fa0f","resolution":{"observed_at":"2026-08-02T11:56:07.082215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14300/citation-record","integrity":"/paper/2505.14300/integrity","json":"/paper/2505.14300/citation-record.json","paper":"/paper/2505.14300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T15:43:28.543259Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:28.543259Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:055ace83c0c9a46bb68504ae16c30b0d8765715b11f4c59e77e0ed39bbd3e38f","observation_id":"9cfadd81-d068-4024-a70c-ecc59ea4ab69","resolution":{"observed_at":"2026-08-07T15:43:28.543259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09565","last_updated":"2025-02-08T23:58:36Z","snapshot_observed_at":"2026-08-12T22:00:21.320460Z","submitted_at":"2024-12-12T18:49:53Z","title":"Obfuscated Activations Bypass LLM Latent-Space Defenses","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09565","snapshot_observed_at":"2026-08-07T15:43:30.275006Z","title":"Mechanistic anomaly dataset huggingface repository, December 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.275006Z"},"links":{"cited_paper":"/paper/2412.09565","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:40c0897448f563ec82b3297f840fc689a672f87f6f4c94cd18384a8345e97cd8","observation_id":"5149911b-abee-4c46-9cbc-ff6d294fcf87","resolution":{"observed_at":"2026-08-07T15:43:30.275006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03336","last_updated":"2024-11-07T09:18:26Z","snapshot_observed_at":"2026-08-12T22:12:31.161680Z","submitted_at":"2024-10-29T17:55:29Z","title":"Towards evaluations-based safety cases for AI scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03336","snapshot_observed_at":"2026-08-07T15:43:30.414746Z","title":"Towards evaluations-based safety cases for ai scheming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.414746Z"},"links":{"cited_paper":"/paper/2411.03336","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:a38715c72b88124eca5247b65baa469058fe9901cb018ccc22683aed508b52b4","observation_id":"06bb95d0-789c-442c-a834-1485bcff7de0","resolution":{"observed_at":"2026-08-07T15:43:30.414746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.05991","last_updated":"2021-04-03T11:18:12Z","snapshot_observed_at":"2026-08-10T21:24:05.898167Z","submitted_at":"2020-03-12T19:38:47Z","title":"Autoencoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.05991","snapshot_observed_at":"2026-08-07T15:43:30.498720Z","title":"Autoencoders, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.498720Z"},"links":{"cited_paper":"/paper/2003.05991","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:1ef15afbfeef90f54af9fc22b74ac9921534970fd51745937dbcfea1e18bdc94","observation_id":"d161dd7e-dea4-4a28-9099-57735193d468","resolution":{"observed_at":"2026-08-07T15:43:30.498720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00667","last_updated":"2023-09-01T17:27:37Z","snapshot_observed_at":"2026-08-13T10:22:28.516325Z","submitted_at":"2023-09-01T17:27:37Z","title":"Taken out of context: On measuring situational awareness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00667","snapshot_observed_at":"2026-08-07T15:43:30.616157Z","title":"Taken out of context: On measuring situational awareness in llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.616157Z"},"links":{"cited_paper":"/paper/2309.00667","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:e308917e7c411ebc5eeff95d42e6c6835e9cc33e0d17d03540b285c5bb25494a","observation_id":"1a98e376-f4db-4820-a492-b0f9960b93bd","resolution":{"observed_at":"2026-08-07T15:43:30.616157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21572","last_updated":"2024-10-28T22:08:28Z","snapshot_observed_at":"2026-08-12T22:13:19.169518Z","submitted_at":"2024-10-28T22:08:28Z","title":"Safety cases for frontier AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21572","snapshot_observed_at":"2026-08-07T15:43:30.714748Z","title":"Safety cases for frontier ai, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.714748Z"},"links":{"cited_paper":"/paper/2410.21572","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:f0262214ba380d35cda7a16949408645576aedadae13047e97422cd448d4d657","observation_id":"fb07f58a-a39f-4c14-91d0-5bac347e7115","resolution":{"observed_at":"2026-08-07T15:43:30.714748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08379","last_updated":"2023-11-27T19:30:35Z","snapshot_observed_at":"2026-08-14T05:49:40.433848Z","submitted_at":"2023-11-14T18:42:40Z","title":"Scheming AIs: Will AIs fake alignment during training in order to get power?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08379","snapshot_observed_at":"2026-08-07T15:43:30.785732Z","title":"Scheming ais: Will ais fake alignment during training in order to get power?, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.785732Z"},"links":{"cited_paper":"/paper/2311.08379","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:f4f2af658f47d8c6979962232a06b2ce921b5845e38547711b5b9153ef1531ef","observation_id":"d262e28e-47f4-4895-8452-53709453a4fd","resolution":{"observed_at":"2026-08-07T15:43:30.785732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16851","last_updated":"2023-07-31T17:11:35Z","snapshot_observed_at":"2026-08-13T10:43:51.147477Z","submitted_at":"2023-07-31T17:11:35Z","title":"Towards Trustworthy and Aligned Machine Learning: A Data-centric Survey with Causality Perspectives","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16851","snapshot_observed_at":"2026-08-07T15:43:30.890006Z","title":"Towards trustworthy and aligned machine learning: A data-centric survey with causality perspectives, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.890006Z"},"links":{"cited_paper":"/paper/2307.16851","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:f186b8f70eb2b42eddfcf55408734cd4ef2506604b26c9d277d6e82aa2e3d3d3","observation_id":"f15c433a-b791-443d-8867-e8415ea2486a","resolution":{"observed_at":"2026-08-07T15:43:30.890006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.4230/lipics.itcs.2025.38","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Backdoor defense, learnability and obfuscation, 2025","venue":"arXiv (Cornell University)","work_id":"34110402-f4b4-48ac-aecc-2bd13963f02e","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:30.988869Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:56270410ff3981c44575f0460cc3380840d50a2cc86458930f3608a749d896aa","observation_id":"27927f34-c2c6-4f08-bc6d-efe71bd82580","resolution":{"observed_at":"2026-08-07T15:43:33.973035Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10462","last_updated":"2024-03-18T18:11:46Z","snapshot_observed_at":"2026-08-13T00:53:14.713418Z","submitted_at":"2024-03-15T16:53:13Z","title":"Safety Cases: How to Justify the Safety of Advanced AI Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10462","snapshot_observed_at":"2026-08-07T15:43:31.143723Z","title":"Safety cases: How to justify the safety of advanced ai systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.143723Z"},"links":{"cited_paper":"/paper/2403.10462","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:8f0ae21ae78fea38a39279e9fbfbd64f15097328665dc77821db275452694013","observation_id":"458fbeb4-4769-4618-a27c-d68c9e721794","resolution":{"observed_at":"2026-08-07T15:43:31.143723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.569938Z","title":"Industrial monitoring system, 2025","venue":null,"work_id":"0aae2fb3-c601-48ee-9608-90967d91a932","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.253688Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:7f5be38d7634f03cd36b9c661db51f84bd65d0ec00e215d3525586810ee7b170","observation_id":"3053807f-71d0-48d8-930e-5bfb833a9279","resolution":{"observed_at":"2026-08-07T15:43:36.646763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17618","last_updated":"2024-12-23T14:43:41Z","snapshot_observed_at":"2026-08-11T05:18:58.458470Z","submitted_at":"2024-12-23T14:43:41Z","title":"Dynamic safety cases for frontier AI","version":1},"cited_work":{"arxiv_id":"2412.17618","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.17618","snapshot_observed_at":"2026-08-07T15:43:34.588715Z","title":"Dynamic safety cases for frontier AI","venue":"cs.CY","work_id":"fe31093c-3652-4be7-9eb6-c2aabed88c5b","year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.377089Z"},"links":{"cited_paper":"/paper/2412.17618","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:bd78182094c5262c9370cc12c98e96064f007e0b325152154a7a2c20ac129196","observation_id":"ed1e148c-abaa-4d1d-8bf4-ae87b7a95e22","resolution":{"observed_at":"2026-08-07T15:43:34.679398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10029","last_updated":"2023-12-18T16:43:35Z","snapshot_observed_at":"2026-08-13T05:00:43.239302Z","submitted_at":"2023-12-15T18:49:43Z","title":"Challenges with unsupervised LLM knowledge discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10029","snapshot_observed_at":"2026-08-07T15:43:31.484748Z","title":"Challenges with unsupervised llm knowledge discovery, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.484748Z"},"links":{"cited_paper":"/paper/2312.10029","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:0bf1942999600ca3e592fc50617413429df8ea9fcae73b2a0d5570fb838fb73a","observation_id":"eca34920-2c90-4037-aaea-21f704550070","resolution":{"observed_at":"2026-08-07T15:43:31.484748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04709","last_updated":"2025-05-08T23:00:37Z","snapshot_observed_at":"2026-08-13T13:05:41.356773Z","submitted_at":"2023-01-11T20:42:41Z","title":"Causal Abstraction: A Theoretical Foundation for Mechanistic Interpretability","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04709","snapshot_observed_at":"2026-08-07T15:43:31.583205Z","title":"Causal abstraction: A theoretical foundation for mechanistic interpretability, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.583205Z"},"links":{"cited_paper":"/paper/2301.04709","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:9c24fa6826e9eb8031335c338760b0596bbc71e53a670b4ced19e9b8a82c1d23","observation_id":"60e2b358-386b-40d1-b04e-197bf857f57f","resolution":{"observed_at":"2026-08-07T15:43:31.583205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:43:31.645292Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.645292Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:132cde8c700bd915a74576b268d38a626018a844561d62ea18908840b4dcad6c","observation_id":"b24a5d12-50fd-4626-bcc3-8ce9ecdfd7c5","resolution":{"observed_at":"2026-08-07T15:43:31.645292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-08-13T11:12:58.507759Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-07T15:43:31.745601Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.745601Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:2e5abd5668031fcee7cece4802e5ef021611b150d942083b1274a41e2b654c8e","observation_id":"baccc249-5cf1-47a5-9688-517136c1f0f1","resolution":{"observed_at":"2026-08-07T15:43:31.745601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T15:43:31.832025Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.832025Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:baa574d0996add8a0944cef7cda6cebcac32b5f3c6e64b16e4e21f4abacddcbd","observation_id":"b74ddfec-d8c7-476c-a6dd-91b303de2238","resolution":{"observed_at":"2026-08-07T15:43:31.832025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T15:43:31.900336Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.900336Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:4be5fbd7aced77f6d8663072fbc163923b7665352a4cb1364ddd6582a871f594","observation_id":"c6009f29-91d0-4614-81f5-447ec34b5200","resolution":{"observed_at":"2026-08-07T15:43:31.900336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19384","last_updated":"2025-06-16T10:21:00Z","snapshot_observed_at":"2026-08-14T01:45:56.211716Z","submitted_at":"2024-06-27T17:57:03Z","title":"The Remarkable Robustness of LLMs: Stages of Inference?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19384","snapshot_observed_at":"2026-08-07T15:43:31.973605Z","title":"The remarkable robustness of llms: Stages of inference?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:31.973605Z"},"links":{"cited_paper":"/paper/2406.19384","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:1d95da81ccd235d019136234573e69c3870be9c533c523a747f23974f4c27a1a","observation_id":"61a54966-ee67-49b2-a9fb-331a09beded8","resolution":{"observed_at":"2026-08-07T15:43:31.973605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.378033Z","title":"Me, myself, and ai: The situational awareness dataset (sad) for llms","venue":null,"work_id":"af0cca56-0839-4e5e-903c-3ffc5babf412","year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.113134Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:83f2822ae691a41bb66e69170aa339cc12ab2f07dd63ffb87cafda6493d145a7","observation_id":"df9ad0c5-094e-4e51-92d1-bc206ceb6ae0","resolution":{"observed_at":"2026-08-07T15:43:36.456599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T15:43:32.241219Z","title":"Sgdr: Stochastic gradient descent with warm restarts, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.241219Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:7a27ce14e44fb7fa16dcfbe88762943a43daaf668fc1310fdca12028a35b4dc4","observation_id":"0e0f2d5d-5f7f-49fd-9d31-7072f6bb4463","resolution":{"observed_at":"2026-08-07T15:43:32.241219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T15:43:32.358776Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.358776Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:22745cf27a38082a77004e99e41e647c087e5e9efcfc63a8ee3565be3d2ea678","observation_id":"fc00e302-4b40-4362-b740-9f094539f6e9","resolution":{"observed_at":"2026-08-07T15:43:32.358776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11715","last_updated":"2022-12-19T04:02:37Z","snapshot_observed_at":"2026-08-13T14:20:17.148194Z","submitted_at":"2022-09-23T16:47:19Z","title":"The \"Beatrix'' Resurrections: Robust Backdoor Detection via Gram Matrices","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11715","snapshot_observed_at":"2026-08-07T15:43:32.438935Z","title":"The \" Beatrix '' Resurrections : Robust Backdoor Detection via Gram Matrices , December 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.438935Z"},"links":{"cited_paper":"/paper/2209.11715","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:f8691aabbc96fe02039fbdf436a194dad6825244a41eb4c1c15afbf97f81de15","observation_id":"2e5e159f-8a11-45a7-8260-98f7d073d15f","resolution":{"observed_at":"2026-08-07T15:43:32.438935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:36.170687Z","title":"On the generalized distance in statistics","venue":null,"work_id":"a0ae1f1e-461e-4181-a1a2-e92af9fa820f","year":1936},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.555486Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:95ec5a80e8aae7ba40c5d69c0a0c040656f070cba4b1cac4398a27696c20194c","observation_id":"d8264b3d-2e10-4e6b-84ce-9cc0183e17f6","resolution":{"observed_at":"2026-08-07T15:43:36.255458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04984","last_updated":"2025-01-14T20:16:01Z","snapshot_observed_at":"2026-08-13T03:11:27.778921Z","submitted_at":"2024-12-06T12:09:50Z","title":"Frontier Models are Capable of In-context Scheming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04984","snapshot_observed_at":"2026-08-07T15:43:32.674783Z","title":"Frontier models are capable of in-context scheming, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.674783Z"},"links":{"cited_paper":"/paper/2412.04984","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:fe690bcd92d3b8e58261823081d5d405a6986573ea72b2c0c44ef79a7af1c8f9","observation_id":"70868715-3306-4e10-b4ff-b6e9c50b84ab","resolution":{"observed_at":"2026-08-07T15:43:32.674783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.939174Z","title":"Ai models can be dangerous before public deployment","venue":null,"work_id":"0396cb86-e338-4ea2-a29f-a3315a50544d","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.785394Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:524ba2ca29dd3c85984e62f3d6bdd799e97a84949e3c7fce785ac89e709cf387","observation_id":"5f790046-e524-4b48-bad2-23c3587a4ddd","resolution":{"observed_at":"2026-08-07T15:43:36.055262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.739786Z","title":"Metr’s gpt-4.5 pre-deployment evaluations","venue":null,"work_id":"065f5318-80c8-4658-b8d6-cdeb4b4d9263","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:32.938172Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:adfde1605bb9d0c441e4b44b79b6965c0541d946d1ebff0ed40b4d369a3fbcfd","observation_id":"3853cfd3-2e59-471b-903c-a948c8436cb1","resolution":{"observed_at":"2026-08-07T15:43:35.836871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12768","last_updated":"2025-06-11T12:40:14Z","snapshot_observed_at":"2026-08-12T18:35:02.207771Z","submitted_at":"2024-11-18T07:52:12Z","title":"CROW: Eliminating Backdoors from Large Language Models via Internal Consistency Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12768","snapshot_observed_at":"2026-08-07T15:43:33.051071Z","title":"Pham, Yige Li, and Jun Sun","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.051071Z"},"links":{"cited_paper":"/paper/2411.12768","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:72f87faa57a861770274e988d318e2040d2f49d9f62b59299c8eb6792b796808","observation_id":"1e2c06e0-4ff8-4b4a-b33f-420a00403184","resolution":{"observed_at":"2026-08-07T15:43:33.051071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02673","last_updated":"2023-12-05T11:29:12Z","snapshot_observed_at":"2026-08-13T05:09:39.101511Z","submitted_at":"2023-12-05T11:29:12Z","title":"Robust Backdoor Detection for Deep Learning via Topological Evolution Dynamics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02673","snapshot_observed_at":"2026-08-07T15:43:33.167602Z","title":"Robust Backdoor Detection for Deep Learning via Topological Evolution Dynamics , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.167602Z"},"links":{"cited_paper":"/paper/2312.02673","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:da92bf5e26e0dfbbfdf74be0e42093b209102f54a0dbc6bd076fcb9b4844b2d8","observation_id":"1477b547-3d38-4021-8299-0c3e9ddf5e5f","resolution":{"observed_at":"2026-08-07T15:43:33.167602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.526428Z","title":"Rail track monitoring system, 2025","venue":null,"work_id":"1588f90b-a4ca-4460-9ee2-b2f1a93ac579","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.296688Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:5e8e0a92ed3acf6cb81718551a55cf3322e7a5dbd6f386e76df863a8ed081189","observation_id":"9112b6eb-cb91-4c29-96db-c6593e38f6d1","resolution":{"observed_at":"2026-08-07T15:43:35.640638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14455","last_updated":"2024-04-29T12:37:59Z","snapshot_observed_at":"2026-08-13T05:18:30.235106Z","submitted_at":"2023-11-24T13:09:34Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14455","snapshot_observed_at":"2026-08-07T15:43:33.389364Z","title":"Universal Jailbreak Backdoors from Poisoned Human Feedback , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.389364Z"},"links":{"cited_paper":"/paper/2311.14455","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:501c2911ecc050d1691fa0af3054dc0119b4a9e44f0f828bf0e100d557c7b59c","observation_id":"33bf3e96-e499-4ef8-9020-f5c5256b1d61","resolution":{"observed_at":"2026-08-07T15:43:33.389364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.355893Z","title":"Aviation safety monitoring system, 2025","venue":null,"work_id":"8eae0cec-65c0-48ee-a570-5e0452d4471a","year":2025},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.492380Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:170ae023c621a4cf28264258c098e8abfb588c46a602d9c11a728f11a07c2b42","observation_id":"de4001fd-d646-49fe-a541-54d33e7daedc","resolution":{"observed_at":"2026-08-07T15:43:35.419024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:35.173501Z","title":"The Black Swan: The Impact of the Highly Improbable","venue":null,"work_id":"48c6dba0-c722-4749-afd1-52268954ec2d","year":2007},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.599145Z"},"links":{"citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:116a0e83dbfd1e3aed82aaf3ab46273ba667d54c521026b9d93b76fcabd1acda","observation_id":"91657c50-6cce-4055-9586-22d287e48c43","resolution":{"observed_at":"2026-08-07T15:43:35.233064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:43:33.696833Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.696833Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:0bd92e49bd209169d921390d0c86cca13d83863ee137edb4f0e0465642c2cf87","observation_id":"9650b709-c852-4e4a-8ce9-b4e35eb16c1c","resolution":{"observed_at":"2026-08-07T15:43:33.696833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18166","last_updated":"2024-06-14T07:27:26Z","snapshot_observed_at":"2026-08-12T23:56:09.751659Z","submitted_at":"2024-05-28T13:26:12Z","title":"Defending Large Language Models Against Jailbreak Attacks via Layer-specific Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18166","snapshot_observed_at":"2026-08-07T15:43:33.763079Z","title":"Defending large language models against jailbreak attacks via layer-specific editing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:43:33.763079Z"},"links":{"cited_paper":"/paper/2405.18166","citing_paper":"/paper/2505.14300"},"observation_digest":"sha256:ddb2133798c1dcee5d5b32296a8f063db4a06c57cfdddafa16a31717bfd62675","observation_id":"968a4e6f-0bb3-495f-b052-a572df396cbc","resolution":{"observed_at":"2026-08-07T15:43:33.763079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14300","last_updated":"2026-07-10T00:11:31Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T17:49:31.823309Z","submitted_at":"2025-05-20T12:49:58Z","title":"Beyond Black-Box Obfuscation: Mechanistic Analysis and Defense of White-Box Monitors"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":8},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 4 inbound Pith citation observations for arXiv:2505.14300."}