{"as_of":"2026-08-14T13:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc00055cb2302967b1be4888a8e90d27a00eff5661ebea7d159ea86bd61f6b5b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":50,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:17:59.786686Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":63,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2210.10760","last_updated":"2022-10-19T17:56:10Z","snapshot_observed_at":"2026-07-06T14:07:50.468967Z","submitted_at":"2022-10-19T17:56:10Z","title":"Scaling Laws for Reward Model Overoptimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T09:04:53.129737Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2210.10760"},"observation_digest":"sha256:f09465fa437f98d94dbe0833c2a73a3ac6f187953e5afbe42f5a09bb269ddacc","observation_id":"fe5749d7-f45c-4d5b-ac2d-231543115114","resolution":{"observed_at":"2026-05-19T09:04:53.341962Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2309.08600","last_updated":"2023-10-04T13:17:38Z","snapshot_observed_at":"2026-08-11T07:21:14.568175Z","submitted_at":"2023-09-15T17:56:55Z","title":"Sparse Autoencoders Find Highly Interpretable Features in Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-24T06:42:23.274826Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2309.08600"},"observation_digest":"sha256:237f645455a49f0608de4eb6d7dd1793b0193c26545d8dbedc9e7eaa1fae0feb","observation_id":"becee435-783a-4ffe-8552-f9f561b98347","resolution":{"observed_at":"2026-05-24T06:44:02.226998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2401.02458","last_updated":"2026-04-29T07:43:10Z","snapshot_observed_at":"2026-07-29T23:57:44.096283Z","submitted_at":"2024-01-04T08:00:32Z","title":"Data-Centric Foundation Models in Computational Healthcare: A Survey","version":3},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-05-24T04:13:05.328492Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2401.02458"},"observation_digest":"sha256:c7be894ce0f0d8b0f91b46df22c269965be6c2dbfb43ba4dd35f0a4970bc1270","observation_id":"80067b9f-aa3c-4a40-b1c4-1dc44c00c48a","resolution":{"observed_at":"2026-05-24T04:13:52.783423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2403.19647","last_updated":"2025-03-27T05:44:45Z","snapshot_observed_at":"2026-08-14T07:35:01.333549Z","submitted_at":"2024-03-28T17:56:07Z","title":"Sparse Feature Circuits: Discovering and Editing Interpretable Causal Graphs in Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-13T13:15:10.632115Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2403.19647"},"observation_digest":"sha256:a2551ab3659f86a7419d2ba2c7f0a17620052598e95de10c54bd610709c291bb","observation_id":"3fdd8724-59e7-4815-a791-096d637ecd14","resolution":{"observed_at":"2026-05-13T13:15:10.700429Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-17T14:43:29.496457Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2406.10162"},"observation_digest":"sha256:78ab7eef671b5f35baea2ad183957c5433c7e512d0451523481105cd00c99792","observation_id":"7f903738-a102-44b9-93bd-b147b5d04099","resolution":{"observed_at":"2026-05-17T14:43:30.216305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-12T22:01:11.483062Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08088","last_updated":"2024-11-12T18:45:08Z","snapshot_observed_at":"2026-08-13T05:18:46.329173Z","submitted_at":"2024-11-12T18:45:08Z","title":"Safety case template for frontier AI: A cyber inability argument","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T22:01:11.483062Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2411.08088"},"observation_digest":"sha256:f6fd05b7a5a16672b81034ec67443e0068ca1bae7c5038f361050656f05fbd24","observation_id":"ba9ab7f7-df82-4e25-b00d-d10996e49f89","resolution":{"observed_at":"2026-08-12T22:01:11.483062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-12T21:52:34.659958Z","title":"Harsha Nori, Nicholas King, Scott Mayer McKinney, Dean Carignan, and Eric Horvitz","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.08243","last_updated":"2025-06-03T19:37:50Z","snapshot_observed_at":"2026-08-13T01:37:05.379133Z","submitted_at":"2024-11-12T23:43:20Z","title":"Beyond the Safety Bundle: Auditing the Helpful and Harmless Dataset","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T21:52:34.659958Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2411.08243"},"observation_digest":"sha256:e12af0e11fc831b8e5b0116968d7eefef5403781e0a5761fa84e7d30b3a743f7","observation_id":"2d055cf9-5346-4e77-be64-37b7d71acfff","resolution":{"observed_at":"2026-08-12T21:52:34.659958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-12T15:45:49.995737Z","title":"The Alignment Problem from a Deep Learning Perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00033","last_updated":"2024-11-21T11:36:45Z","snapshot_observed_at":"2026-08-13T21:11:30.732956Z","submitted_at":"2024-11-21T11:36:45Z","title":"Can an AI Agent Safely Run a Government? Existence of Probably Approximately Aligned Policies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:45:49.995737Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2412.00033"},"observation_digest":"sha256:ce4a83ec18436535f9ea660b2e392af9ca8fc4a9abf331f04ef8090357f4a441","observation_id":"88cbea12-254c-4fed-b589-e85e52bdf171","resolution":{"observed_at":"2026-08-12T15:45:49.995737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-10T21:24:10.486442Z","title":"The alignment problem from a deep learning perspective, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04952","last_updated":"2025-01-09T03:59:10Z","snapshot_observed_at":"2026-08-10T21:19:04.243505Z","submitted_at":"2025-01-09T03:59:10Z","title":"Open Problems in Machine Unlearning for AI Safety","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-10T21:24:10.486442Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2501.04952"},"observation_digest":"sha256:7e510f4fb110bce267232d89d2e417bb90fdedca56d65c20b01e9c819c1a8428","observation_id":"9275644b-34da-4f51-bbb5-5d4707c86caa","resolution":{"observed_at":"2026-08-10T21:24:10.486442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-10T05:34:03.897439Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.16946","last_updated":"2025-01-29T14:58:49Z","snapshot_observed_at":"2026-08-13T15:55:48.618627Z","submitted_at":"2025-01-28T13:45:41Z","title":"Gradual Disempowerment: Systemic Existential Risks from Incremental AI Development","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T05:34:03.897439Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2501.16946"},"observation_digest":"sha256:b6109e0dfff1e87803bd83c9d6101f05fb159b6d08173fd4edc5687941277698","observation_id":"35b96a1d-149d-4731-a7c2-12cf6d6dc780","resolution":{"observed_at":"2026-08-10T05:34:03.897439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-08T05:42:43.420807Z","title":"& Mindermann, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.420807Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:a9b325c7658281006042601f1af478a0432e76170aea8a74132a3d8b44fbb08b","observation_id":"e0b1aa67-3e4e-4af0-b51d-799c32909168","resolution":{"observed_at":"2026-08-08T05:42:43.420807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-07T13:28:01.897413Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21800","last_updated":"2025-05-27T22:14:54Z","snapshot_observed_at":"2026-08-10T14:58:15.503036Z","submitted_at":"2025-05-27T22:14:54Z","title":"From Directions to Cones: Exploring Multidimensional Representations of Propositional Facts in LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:28:01.897413Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2505.21800"},"observation_digest":"sha256:1b176faa67fb85905ac3fd0cc4f0ad4da30872a67db74d95938e1f3ccacb867b","observation_id":"69e0e3d4-2040-4c0b-8b68-1c21e8c6a2e8","resolution":{"observed_at":"2026-08-07T13:28:01.897413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-07T11:28:21.158123Z","title":"The alignment problem from a deep learning perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02357","last_updated":"2025-07-10T15:10:23Z","snapshot_observed_at":"2026-08-12T21:27:23.116024Z","submitted_at":"2025-06-03T01:16:34Z","title":"Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:28:21.158123Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.02357"},"observation_digest":"sha256:1f7a3efb3df52abab05f07e8704c912fbef176446936cff11ec6e95e168faff8","observation_id":"8e0d26c6-80e1-46c1-9551-0cc53537e299","resolution":{"observed_at":"2026-08-07T11:28:21.158123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-07T11:39:52.329174Z","title":"Chan, and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06352","last_updated":"2025-06-02T18:54:18Z","snapshot_observed_at":"2026-08-13T04:49:40.278189Z","submitted_at":"2025-06-02T18:54:18Z","title":"Will artificial agents pursue power by default?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.329174Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.06352"},"observation_digest":"sha256:55f5e4bccc3a8e06969d70f02e6cdbe26b555bfae1b87a3f55354bbcb21a0d69","observation_id":"de07081a-edd7-4381-b169-5490e630346d","resolution":{"observed_at":"2026-08-07T11:39:52.329174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-07T05:51:59.350948Z","title":"Chan and S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06959","last_updated":"2025-06-08T01:01:06Z","snapshot_observed_at":"2026-08-10T22:58:08.231947Z","submitted_at":"2025-06-08T01:01:06Z","title":"Deontically Constrained Policy Improvement in Reinforcement Learning Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:51:59.350948Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.06959"},"observation_digest":"sha256:2defda69f870a33237045fb5d9a1113425d44ad1ee39e9c418e84c32976ebf71","observation_id":"d9f40715-cc08-47b5-80ec-c53063625578","resolution":{"observed_at":"2026-08-07T05:51:59.350948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T23:26:57.474356Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17846","last_updated":"2025-06-21T22:45:19Z","snapshot_observed_at":"2026-08-14T06:13:12.101360Z","submitted_at":"2025-06-21T22:45:19Z","title":"Out of Control -- Why Alignment Needs Formal Control Theory (and an Alignment Control Stack)","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:26:57.474356Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.17846"},"observation_digest":"sha256:6864650fcd2241d95c84851c89d5e7d0f573e0adca4e6bdc8af71343a2b3e41c","observation_id":"972a95bd-1328-4030-a171-307a97df5f0c","resolution":{"observed_at":"2026-08-06T23:26:57.474356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T23:29:28.487492Z","title":"doi: 10.18653/v1/2022.emnlp-main.759","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17930","last_updated":"2025-06-22T07:53:07Z","snapshot_observed_at":"2026-08-13T19:04:06.560012Z","submitted_at":"2025-06-22T07:53:07Z","title":"Evolving Prompts In-Context: An Open-ended, Self-replicating Perspective","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:29:28.487492Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.17930"},"observation_digest":"sha256:432b5f18aacc13f099ee6aeeed54b9e39baf8182a2914bd2161cd89a76b2fc27","observation_id":"c8ab42da-82a3-43ea-a7ff-b988c3df64ca","resolution":{"observed_at":"2026-08-06T23:29:28.487492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T21:58:22.984820Z","title":"arXiv preprint arXiv:2209.00626","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22957","last_updated":"2025-08-27T20:38:04Z","snapshot_observed_at":"2026-08-12T00:00:00.258627Z","submitted_at":"2025-06-28T17:22:59Z","title":"Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:22.984820Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2506.22957"},"observation_digest":"sha256:5ccd3fce22865faeaf4ec5925a4dac4a5d8d1e44e27c6ba24cf596b15a080d10","observation_id":"c32a77d8-2d1a-4f83-8f61-4c5584cf15a4","resolution":{"observed_at":"2026-08-06T21:58:22.984820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T21:07:11.445678Z","title":"The alignment problem from a deep learn- ing perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00951","last_updated":"2025-07-12T02:50:17Z","snapshot_observed_at":"2026-08-08T07:11:19.635744Z","submitted_at":"2025-07-01T16:52:25Z","title":"Thinking Beyond Tokens: From Brain-Inspired Intelligence to Cognitive Foundations for Artificial General Intelligence and its Societal Impact","version":3},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:11.445678Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.00951"},"observation_digest":"sha256:cbc3421af7a0ff331f4802b42efaf1586e77558059295dcfae490363099a9a18","observation_id":"29342e78-4d90-4680-9744-bc205f44e80d","resolution":{"observed_at":"2026-08-06T21:07:11.445678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T20:18:15.417317Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03409","last_updated":"2025-07-04T09:16:11Z","snapshot_observed_at":"2026-08-14T06:14:50.175666Z","submitted_at":"2025-07-04T09:16:11Z","title":"Lessons from a Chimp: AI \"Scheming\" and the Quest for Ape Language","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:18:15.417317Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.03409"},"observation_digest":"sha256:2afe6d4622027bfdd61560a5a2b7d3922f4d97699924297f0bf6adb7121f3e40","observation_id":"efb17172-59eb-40dd-a6ba-dc2aaa5117ae","resolution":{"observed_at":"2026-08-06T20:18:15.417317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T16:39:36.793291Z","title":"arXiv:2209.00626","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12872","last_updated":"2025-07-17T07:45:53Z","snapshot_observed_at":"2026-08-11T10:32:07.446828Z","submitted_at":"2025-07-17T07:45:53Z","title":"Manipulation Attacks by Misaligned AI: Risk Analysis and Safety Case Framework","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:36.793291Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.12872"},"observation_digest":"sha256:77c10ed7e70e1286462105b1ed4133e7a7453c8e183b86f592234abbf47014a5","observation_id":"7579f224-aec7-4c7a-b527-bf7b68bc9725","resolution":{"observed_at":"2026-08-06T16:39:36.793291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-06T15:41:34.328537Z","title":"In arXiv:2209.00626, pp","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15328","last_updated":"2025-07-21T07:37:28Z","snapshot_observed_at":"2026-08-09T08:15:39.030873Z","submitted_at":"2025-07-21T07:37:28Z","title":"On the Inevitability of Left-Leaning Political Bias in Aligned Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:41:34.328537Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2507.15328"},"observation_digest":"sha256:f25427052e657231ec1dd796a68e75f02548ffb3978fc0308b30eb802dba5e90","observation_id":"9290f995-4ac4-4161-91df-229157a44fe6","resolution":{"observed_at":"2026-08-06T15:41:34.328537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T18:42:02.769943Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15847","last_updated":"2025-08-19T22:57:17Z","snapshot_observed_at":"2026-08-09T23:43:09.455213Z","submitted_at":"2025-08-19T22:57:17Z","title":"Mechanistic Exploration of Backdoored Large Language Model Attention Patterns","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T18:42:02.769943Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2508.15847"},"observation_digest":"sha256:586f2a1aa7ab637b74dc91c51e9f9766d14038279b8af3c5fc14e587f16866f4","observation_id":"33df2d56-405c-4584-b48d-f0f05d6b4a74","resolution":{"observed_at":"2026-08-05T18:42:02.769943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-04T07:21:22.518530Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.26518","last_updated":"2026-06-25T13:34:02Z","snapshot_observed_at":"2026-08-10T01:21:56.171636Z","submitted_at":"2025-10-30T14:11:52Z","title":"Human-AI Complementarity: A Goal for Amplified Oversight","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:22.518530Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2510.26518"},"observation_digest":"sha256:d4fcfe0500beb2d09e763f1b1dd51392df482365615e1e0a061872698c5785f6","observation_id":"e369c779-39c4-4540-be9b-f88018797938","resolution":{"observed_at":"2026-08-04T07:21:22.518530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-03T06:35:33.921059Z","title":"Nikankin, Y ., Reusch, A., Mueller, A., and Belinkov, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22594","last_updated":"2026-06-11T01:15:40Z","snapshot_observed_at":"2026-08-13T13:46:27.459261Z","submitted_at":"2026-01-30T05:41:19Z","title":"Language Model Circuits Are Sparse in the Neuron Basis","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:35:33.921059Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2601.22594"},"observation_digest":"sha256:a14dcd2d1009b4f27c75c91dbc8c769515f7bb6c3bd5f5c55c5dcc30af0f6d4c","observation_id":"bad157e3-c7d8-4752-9875-64b18cc0ca4e","resolution":{"observed_at":"2026-08-03T06:35:33.921059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2603.18633","last_updated":"2026-04-04T15:43:36Z","snapshot_observed_at":"2026-08-12T15:19:51.603520Z","submitted_at":"2026-03-19T08:58:10Z","title":"An Onto-Relational-Sophic Framework for Governing Synthetic Minds","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T08:57:58.369793Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2603.18633"},"observation_digest":"sha256:ca722043db791a90f3eeb03a1a5befb59038d9e64ad9949f3d5652cff51994c4","observation_id":"2b2b6fd6-4280-4d26-866d-b1890dbd293a","resolution":{"observed_at":"2026-05-15T08:59:53.036090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2603.19282","last_updated":"2026-04-06T18:38:02Z","snapshot_observed_at":"2026-08-10T22:17:18.696895Z","submitted_at":"2026-03-02T16:10:34Z","title":"Framing Effects in Independent-Agent Large Language Models: A Cross-Family Behavioral Analysis","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T18:01:02.298383Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2603.19282"},"observation_digest":"sha256:94d6462d78b9c43453d873bb6bf1841696ef3a95ee9afffbe9a1ca12e7efa1dd","observation_id":"e1c90d48-7394-4748-8c3a-a1470b975659","resolution":{"observed_at":"2026-05-15T18:01:25.299330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2604.01346","last_updated":"2026-04-06T19:07:02Z","snapshot_observed_at":"2026-08-11T05:42:27.903818Z","submitted_at":"2026-04-01T19:57:33Z","title":"Safety, Security, and Cognitive Risks in World Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T22:35:46.126714Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2604.01346"},"observation_digest":"sha256:6a214fb178571b775b5a5e34078fb1e1dda59ddcbc97f0112d8aa3e98416a929","observation_id":"47bb1925-c2b9-463a-800c-14aee472f533","resolution":{"observed_at":"2026-05-13T22:38:22.257456Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2604.02720","last_updated":"2026-06-06T04:29:46Z","snapshot_observed_at":"2026-08-12T23:55:44.516515Z","submitted_at":"2026-04-03T04:26:18Z","title":"Cognitive Comparability and the Limits of Governance: Evaluating Authority Under Radical Capability Asymmetry","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T19:08:06.518978Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2604.02720"},"observation_digest":"sha256:c88a37dfe87bbdb832c5878a33a65de733acf557df5247db9e47df5d0928567b","observation_id":"8ba639fd-1849-487f-bc2b-ae7d9f8abb23","resolution":{"observed_at":"2026-05-13T19:08:09.498955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-08-14T09:00:24.133684Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T05:48:44.687520Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2604.17596"},"observation_digest":"sha256:0337921ef4f8b619aa0712b1c3568389879e24689e96c8595e37cffbc9fac283","observation_id":"1c211139-d19d-4576-a4c8-b30f3669bb99","resolution":{"observed_at":"2026-05-10T05:51:10.083360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2604.20805","last_updated":"2026-04-22T17:36:52Z","snapshot_observed_at":"2026-08-12T12:13:46.835217Z","submitted_at":"2026-04-22T17:36:52Z","title":"Relative Principals, Pluralistic Alignment, and the Structural Value Alignment Problem","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-09T23:02:34.564375Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2604.20805"},"observation_digest":"sha256:4d213bd94e8e5f6a6e5719b2aa10f2876a5874327794c899439a8a046c993387","observation_id":"b9088d91-92c3-476b-b250-2d987df8f3f9","resolution":{"observed_at":"2026-05-09T23:04:17.665895Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2605.11134","last_updated":"2026-05-29T17:16:57Z","snapshot_observed_at":"2026-08-11T09:54:15.520173Z","submitted_at":"2026-05-11T18:41:12Z","title":"Spurious Correlation Learning in Preference Optimization: Mechanisms, Consequences, and Mitigation via Tie Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-13T06:30:51.812541Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2605.11134"},"observation_digest":"sha256:8c95467762b306e1609b0e534a207c237c6c74dad83e921ab89465819a1bcbda","observation_id":"dd349a6b-154b-45e5-8c58-c9bdb20405b2","resolution":{"observed_at":"2026-05-13T06:32:24.282885Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2605.16035","last_updated":"2026-05-15T15:10:33Z","snapshot_observed_at":"2026-08-13T16:41:58.831347Z","submitted_at":"2026-05-15T15:10:33Z","title":"Who Owns This Agent? Tracing AI Agents Back to Their Owners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T17:26:23.647993Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2605.16035"},"observation_digest":"sha256:1d9e9ef86845b041e9630ccabace93182ba66663afdddf32556957d4cf7bb4b9","observation_id":"5e13343c-e132-49c4-a373-33625775d819","resolution":{"observed_at":"2026-05-20T17:28:47.944759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2605.23565","last_updated":"2026-05-22T12:31:18Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:31:18Z","title":"Understanding Goal Generalisation in Sequential Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-25T04:49:50.034743Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2605.23565"},"observation_digest":"sha256:26c6994c196c025fa4d46315699e356f01c6779a5b0ef6aab0ebb2d956883bb1","observation_id":"17b2db02-300d-4e4e-bc92-da4f815dc981","resolution":{"observed_at":"2026-05-25T04:50:20.720789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-30T22:16:47.743387Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:dc4d7c0ffbe6798237061518c693bbe97f8ed0ec9557ab1c1ecb75b9e1c6fb56","observation_id":"eec751e3-a391-4e71-8792-7a21e330318b","resolution":{"observed_at":"2026-07-01T14:05:47.156294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-07-12T17:03:44.315006Z","title":"The alignment problem from a deep learning perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.05194","last_updated":"2026-07-08T19:54:16Z","snapshot_observed_at":"2026-08-06T06:51:53.907927Z","submitted_at":"2026-05-11T21:09:00Z","title":"Temporal Preference Concepts and their Functions in a Large Language Model","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T17:03:44.315006Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.05194"},"observation_digest":"sha256:d8591d5ad5a8de10ded909f415f97ccbcfb3e9acbaa01111702887c3ab15cca0","observation_id":"cba9c881-9c24-4a4d-a12b-239c951161cf","resolution":{"observed_at":"2026-07-12T17:03:44.315006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.06028","last_updated":"2026-06-04T11:21:16Z","snapshot_observed_at":"2026-08-02T16:47:39.830550Z","submitted_at":"2026-06-04T11:21:16Z","title":"Misaligned AI as a New Insider Risk","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T23:20:11.068720Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.06028"},"observation_digest":"sha256:00ddabb3befaedc124443da5dc8bda87f1ea368e064400ba40b2a61a99de5c24","observation_id":"5e41e396-90c9-4ddf-9ede-91913fab68b7","resolution":{"observed_at":"2026-07-02T15:47:06.843497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.07998","last_updated":"2026-08-08T09:14:20Z","snapshot_observed_at":"2026-08-14T07:12:12.616053Z","submitted_at":"2026-06-06T06:33:03Z","title":"Enhancing AI Interpretability with Localised Architectures","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T20:21:00.330552Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.07998"},"observation_digest":"sha256:9face9fae09ac8c29531b2aba3b38b6a34283d76c0c718491535b58d269416b7","observation_id":"f216dbdc-5887-40b9-8baf-b10e1ef4225c","resolution":{"observed_at":"2026-07-02T20:37:22.506038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.10711","last_updated":"2026-07-15T14:06:51Z","snapshot_observed_at":"2026-08-12T16:59:33.136561Z","submitted_at":"2026-06-09T11:15:48Z","title":"The Agentic Web Requires New Normative Infrastructure","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-27T11:55:10.777827Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.10711"},"observation_digest":"sha256:02114a247c84642fda707075792d137a8282eba013449386a1070ecb528f06db","observation_id":"1f89b684-e6f5-48a8-91a1-ef694013a808","resolution":{"observed_at":"2026-06-28T02:41:32.525097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.17478","last_updated":"2026-06-16T03:41:29Z","snapshot_observed_at":"2026-08-06T02:24:09.497908Z","submitted_at":"2026-06-16T03:41:29Z","title":"Decoding Hidden Deception in Reasoning LLMs: Activation Explainers for Deception Auditing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T01:28:38.810889Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.17478"},"observation_digest":"sha256:00cb5da22d355d4e28389b803b903b2326ff1d8fb608edea32d003181d340edf","observation_id":"f7ed8e7a-2c63-4b96-9d4a-aaf0ffaec409","resolution":{"observed_at":"2026-07-03T20:18:56.660392Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2606.29657","last_updated":"2026-07-10T21:53:01Z","snapshot_observed_at":"2026-07-16T23:17:54.967525Z","submitted_at":"2026-06-28T23:55:29Z","title":"Safety from Honesty in a Disinterested AI Predictor","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-30T06:53:19.737408Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.29657"},"observation_digest":"sha256:900959f17032356e9ea1f9cdc9d2a983c10cee290b628598a6dc8088b571d074","observation_id":"48be50e9-231b-48f4-a39b-3da11af23294","resolution":{"observed_at":"2026-06-30T06:54:20.207972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-07-14T17:02:19.189814Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.29657","last_updated":"2026-07-10T21:53:01Z","snapshot_observed_at":"2026-07-16T23:17:54.967525Z","submitted_at":"2026-06-28T23:55:29Z","title":"Safety from Honesty in a Disinterested AI Predictor","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-14T17:02:19.189814Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2606.29657"},"observation_digest":"sha256:b750297e472f4672d7c8e163014470ceecb56aec8b93e18ac331850d1e455d43","observation_id":"8aa9d0fd-2017-4d11-8eaf-cfb0e2b86185","resolution":{"observed_at":"2026-07-14T17:02:19.189814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-07-12T05:44:33.099337Z","title":"The Alignment Problem from a Deep Learning Perspective , publisher =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02972","last_updated":"2026-07-03T05:28:43Z","snapshot_observed_at":"2026-08-13T09:54:20.407110Z","submitted_at":"2026-07-03T05:28:43Z","title":"A Scalable Approach to Evaluating Moral Sensitivity in LLMs","version":1},"reference_index":135,"source":"arxiv_source","source_observed_at":"2026-07-12T05:44:33.099337Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.02972"},"observation_digest":"sha256:f8e5abf31082f9a2d5294858a952bb83fe41698c2d85b0ac34e49d6dab83b9e5","observation_id":"d36bd4a5-e4af-4fdc-be91-b373b5c89ff1","resolution":{"observed_at":"2026-07-12T05:44:33.099337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2607.07605","last_updated":"2026-07-08T16:22:27Z","snapshot_observed_at":"2026-08-12T12:13:40.020068Z","submitted_at":"2026-07-08T16:22:27Z","title":"User identity conditions moral wrongness ratings in non-reasoning large language models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T05:37:58.875536Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.07605"},"observation_digest":"sha256:fe2fac749ff12a245229d9a3caf8d213e57b009fd5ebca4f31a2eddfad41301e","observation_id":"610c9187-8023-460f-92c3-0dab0ec79e0c","resolution":{"observed_at":"2026-07-09T05:46:01.555826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":"2209.00626","doi":"10.48550/arxiv.2209.00626","metadata_source":"pith","pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Alignment Problem from a Deep Learning Perspective , May 2025","venue":"cs.AI","work_id":"91978697-08f5-4cd8-81ba-c0143831788f","year":2022},"citing_paper":{"arxiv_id":"2607.08066","last_updated":"2026-07-09T02:48:36Z","snapshot_observed_at":"2026-08-13T03:24:37.270410Z","submitted_at":"2026-07-09T02:48:36Z","title":"Persuasion Attacks Can Decrease Effectiveness of CoT Monitoring","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-10T00:52:47.537142Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.08066"},"observation_digest":"sha256:0fd56c6cacfe074bac5a65b5a0c8adb597b535a5c4d8e8d61e3896ab34e05e71","observation_id":"48ff409a-ace0-4170-99e4-352dff6e8235","resolution":{"observed_at":"2026-07-10T00:56:41.011024Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:50:06.167626+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-01T16:16:14.799670Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18069","last_updated":"2026-07-20T15:36:03Z","snapshot_observed_at":"2026-08-13T18:21:51.324748Z","submitted_at":"2026-07-20T15:36:03Z","title":"Hardware Mechanisms to Dynamically Throttle AI Performance","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T16:16:14.799670Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.18069"},"observation_digest":"sha256:294384a8004670ce37c470d257cab5fd8f5d3f49827f1246fa7eddb2c8f5ec16","observation_id":"53f8cf84-4132-43b9-b21f-e9005a1172ba","resolution":{"observed_at":"2026-08-01T16:16:14.799670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-02T13:58:41.660778Z","title":"The alignment problem from a deep learning perspective.arXiv preprint arXiv:2209.00626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18258","last_updated":"2026-05-15T09:09:57Z","snapshot_observed_at":"2026-08-11T02:16:15.347878Z","submitted_at":"2026-05-15T09:09:57Z","title":"S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T13:58:41.660778Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.18258"},"observation_digest":"sha256:fd2999b823ad9a44a840a07564cc017b58933fef92daa24f7bc3c47b308d68e9","observation_id":"f26ac867-d237-4dfe-8199-f00c18ea6625","resolution":{"observed_at":"2026-08-02T13:58:41.660778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-01T05:36:11.664750Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22188","last_updated":"2026-07-24T10:59:34Z","snapshot_observed_at":"2026-08-13T01:41:39.847873Z","submitted_at":"2026-07-24T10:59:34Z","title":"Draining the Energy Commons: Self-Defeating Over-Appropriation as a Coordination Failure in Agentic LLM Collectives","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T05:36:11.664750Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2607.22188"},"observation_digest":"sha256:848b8091946a5453f527dfd24717729fd42bf446267f5ee61dbaab830fded34d","observation_id":"8a82ba0b-24ce-44b2-bb39-f914401fc253","resolution":{"observed_at":"2026-08-01T05:36:11.664750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-10T11:13:43.700315Z","title":"The alignment problem from a deep learning perspective","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.07280","last_updated":"2026-08-07T14:39:10Z","snapshot_observed_at":"2026-08-14T07:22:10.252692Z","submitted_at":"2026-08-07T14:39:10Z","title":"Why Study Emergent Behavior When You Can Regulate It? Aligning Multi-Agent Systems with Reward Prediction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T11:13:43.700315Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2608.07280"},"observation_digest":"sha256:c773cf194d23c91ad19ef5dd91a75af7e726721f6423c9b1f499edaaedca37bb","observation_id":"1814b975-231d-4f06-9a20-ce47150dea6f","resolution":{"observed_at":"2026-08-10T11:13:43.700315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00626","snapshot_observed_at":"2026-08-14T04:17:59.786686Z","title":"The alignment problem from a deep learning perspective, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.10209","last_updated":"2026-08-10T20:22:13Z","snapshot_observed_at":"2026-08-14T13:10:25.749176Z","submitted_at":"2026-08-10T20:22:13Z","title":"Evaluation-Conditioned Training: Teaching Models to Generalize to Stronger Oversight Regimes","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:17:59.786686Z"},"links":{"cited_paper":"/paper/2209.00626","citing_paper":"/paper/2608.10209"},"observation_digest":"sha256:4b84c913f29adfd63f185342870722976fdee3820491a7ca67226b672d678eb6","observation_id":"745f7d37-64b8-4d71-ac37-90849517e8c3","resolution":{"observed_at":"2026-08-14T04:17:59.786686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2209.00626/citation-record","integrity":"/paper/2209.00626/integrity","json":"/paper/2209.00626/citation-record.json","paper":"/paper/2209.00626"},"outbound":[],"paper":{"arxiv_id":"2209.00626","last_updated":"2025-05-04T15:50:51Z","latest_version":8,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T14:37:00.525526Z","submitted_at":"2022-08-30T02:12:47Z","title":"The Alignment Problem from a Deep Learning Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 50 inbound Pith citation observations for arXiv:2209.00626."}