{"as_of":"2026-08-13T23:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5eb60ce6a73465878878e5c70eba736a98f262703790449b03bd1380d9a6b92","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":64,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T21:26:42.160078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":14,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2405.00592","last_updated":"2025-06-30T15:11:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-01T15:59:00Z","title":"Scaling and renormalization in high-dimensional regression","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T01:54:48.781227Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2405.00592"},"observation_digest":"sha256:5adcc012e7934f47fa743c85b5a51c4445e49a86f0ad6d527f18f6a1cc74a7a1","observation_id":"e47d2fa6-25b8-4557-8bcc-89e4f3513b11","resolution":{"observed_at":"2026-05-24T01:55:55.089386Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2406.18495","last_updated":"2024-12-09T20:21:56Z","snapshot_observed_at":"2026-08-12T20:12:20.465098Z","submitted_at":"2024-06-26T16:58:20Z","title":"WildGuard: Open One-Stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T16:25:14.744887Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2406.18495"},"observation_digest":"sha256:e4e2f3ffe69588fdab6cfd84189bd1555aa18a76b72be80e2c6a76b374438639","observation_id":"07a1da5b-b4f0-44e8-b987-1a99bf9035de","resolution":{"observed_at":"2026-05-17T16:25:14.801617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T21:26:42.160078Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.08790","last_updated":"2024-11-13T17:16:48Z","snapshot_observed_at":"2026-08-12T21:17:52.516950Z","submitted_at":"2024-11-13T17:16:48Z","title":"Can sparse autoencoders be used to decompose and interpret steering vectors?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T21:26:42.160078Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.08790"},"observation_digest":"sha256:da5c0436d8b80a633ceb840c3dd916a96eee08807e5042f93df0f158a7d5e62f","observation_id":"abb05878-58e8-4ea9-935f-d3ea7f231ea4","resolution":{"observed_at":"2026-08-12T21:26:42.160078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T21:05:18.257404Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-08-12T20:57:45.470599Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T21:05:18.257404Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.09125"},"observation_digest":"sha256:d017abd9a31f480284f2461c78516014dd5150925daf6ece112835b24135fb09","observation_id":"499b9844-f69f-4404-bd0a-06424cd433fd","resolution":{"observed_at":"2026-08-12T21:05:18.257404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T19:41:19.617548Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10414","last_updated":"2024-11-15T18:34:07Z","snapshot_observed_at":"2026-08-12T19:36:09.487518Z","submitted_at":"2024-11-15T18:34:07Z","title":"Llama Guard 3 Vision: Safeguarding Human-AI Image Understanding Conversations","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T19:41:19.617548Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.10414"},"observation_digest":"sha256:4bd24289c155567d78cd59f7e90e0e1a81f642672d86cc8d00ff3e24b83638f6","observation_id":"1ffa0eb6-c7c4-4deb-b108-8acbd635c507","resolution":{"observed_at":"2026-08-12T19:41:19.617548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-12T13:41:45.982526Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16035","last_updated":"2024-11-25T01:48:09Z","snapshot_observed_at":"2026-08-13T01:06:40.533434Z","submitted_at":"2024-11-25T01:48:09Z","title":"Predicting Emergent Capabilities by Finetuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T13:41:45.982526Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2411.16035"},"observation_digest":"sha256:df7a3cb5233a73acc505319b51ee0e033748e52ee7500d11e6ab2a3c564fc25a","observation_id":"8bdcc17c-1756-49fd-b3e0-98dcec4f223b","resolution":{"observed_at":"2026-08-12T13:41:45.982526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T19:11:48.425423Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07111","last_updated":"2024-12-10T01:56:30Z","snapshot_observed_at":"2026-08-13T09:24:45.899219Z","submitted_at":"2024-12-10T01:56:30Z","title":"Predictable Emergent Abilities of LLMs: Proxy Tasks Are All You Need","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T19:11:48.425423Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.07111"},"observation_digest":"sha256:460fac402d768c16dde2020dc276170b8944884192fc3c36d2a714b41525d99f","observation_id":"4c84a848-ebed-4799-a5fc-50bcde6cd406","resolution":{"observed_at":"2026-08-11T19:11:48.425423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T18:30:15.413126Z","title":"S., Jenner, E., Casper, S., Sourbut, O., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.07942","last_updated":"2024-12-10T22:01:38Z","snapshot_observed_at":"2026-08-13T14:43:20.745414Z","submitted_at":"2024-12-10T22:01:38Z","title":"Neural Scaling Laws Rooted in the Data Distribution","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T18:30:15.413126Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.07942"},"observation_digest":"sha256:702964a228f1e55805c5ee40c977a00d32aca00f8264caa6cf570ad74bae4cf0","observation_id":"c03342b6-9e6c-46da-ad0b-1fcb20765b59","resolution":{"observed_at":"2026-08-11T18:30:15.413126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T16:59:11.424767Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09565","last_updated":"2025-02-08T23:58:36Z","snapshot_observed_at":"2026-08-12T22:00:21.320460Z","submitted_at":"2024-12-12T18:49:53Z","title":"Obfuscated Activations Bypass LLM Latent-Space Defenses","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:59:11.424767Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.09565"},"observation_digest":"sha256:d61615befdcd071f4962ad2a4e2dc82a28a10dbe7ee0e0ebed4fd043f5de4c5f","observation_id":"97645858-2052-4b3a-9109-d47e732b2347","resolution":{"observed_at":"2026-08-11T16:59:11.424767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T13:10:19.011861Z","title":"S.; Jenner, E.; Casper, S.; Sourbut, O.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13471","last_updated":"2024-12-18T03:36:08Z","snapshot_observed_at":"2026-08-13T07:36:59.269141Z","submitted_at":"2024-12-18T03:36:08Z","title":"Gradual Vigilance and Interval Communication: Enhancing Value Alignment in Multi-Agent Debates","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T13:10:19.011861Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.13471"},"observation_digest":"sha256:b85148822750b6aab06573f63e96e478b15a56c50422bc6a57a45dc8c3ea041b","observation_id":"9390ee86-a5d9-4451-bedf-148ca9ffb44d","resolution":{"observed_at":"2026-08-11T13:10:19.011861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T12:47:48.277131Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13821","last_updated":"2024-12-18T13:10:35Z","snapshot_observed_at":"2026-08-11T14:37:42.144730Z","submitted_at":"2024-12-18T13:10:35Z","title":"Towards Responsible Governing AI Proliferation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:47:48.277131Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.13821"},"observation_digest":"sha256:c1f7d87ff11af806e82367354344b7c5898fa7ecdd307577a33bb65bf4460bc0","observation_id":"94a84c6a-a27e-4769-a43b-42f026ef23e9","resolution":{"observed_at":"2026-08-11T12:47:48.277131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-11T10:42:47.257659Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16355","last_updated":"2025-04-02T19:56:19Z","snapshot_observed_at":"2026-08-13T13:39:39.586765Z","submitted_at":"2024-12-20T21:34:43Z","title":"Social Science Is Necessary for Operationalizing Socially Responsible Foundation Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T10:42:47.257659Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2412.16355"},"observation_digest":"sha256:d5fa4648612e8036b01783818df8c4acacf324ef18c6f86add023fa0a736d6e8","observation_id":"e5d1ffb1-306f-4bb6-a7dd-2e27061568e2","resolution":{"observed_at":"2026-08-11T10:42:47.257659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T22:53:20.428520Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00517","last_updated":"2024-12-31T16:01:25Z","snapshot_observed_at":"2026-08-13T12:09:54.212124Z","submitted_at":"2024-12-31T16:01:25Z","title":"A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:20.428520Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.00517"},"observation_digest":"sha256:b2f37b4944e913615e8b6433fd7b94f4f68e844e69d5de725a242b9ed8da838d","observation_id":"9c9485fd-3d9b-48a2-a535-f7d52dd85d64","resolution":{"observed_at":"2026-08-10T22:53:20.428520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T22:35:26.875258Z","title":"Valérie JV Broers, Céline De Breucker, Stephan Van den Broucke, and Olivier Luminet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02018","last_updated":"2025-01-02T15:15:38Z","snapshot_observed_at":"2026-08-13T21:57:52.174751Z","submitted_at":"2025-01-02T15:15:38Z","title":"Safeguarding Large Language Models in Real-time with Tunable Safety-Performance Trade-offs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:35:26.875258Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.02018"},"observation_digest":"sha256:737beef1e619cd5ad9076ffd6d0bd38b027279815e58a4d05e92683e3afd101b","observation_id":"b11812df-a75e-499f-a9e1-35055655b0f2","resolution":{"observed_at":"2026-08-10T22:35:26.875258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T21:18:11.730920Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.05398","last_updated":"2025-01-09T17:47:34Z","snapshot_observed_at":"2026-08-13T04:53:24.138704Z","submitted_at":"2025-01-09T17:47:34Z","title":"Mechanistic understanding and validation of large AI models with SemanticLens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:18:11.730920Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.05398"},"observation_digest":"sha256:2bc49fcb4f3bcbe1cf546344d715bc5193640683347c00a6a951cc7b65a66eea","observation_id":"edaf3004-9b57-4970-a514-98992a9076e3","resolution":{"observed_at":"2026-08-10T21:18:11.730920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T20:35:52.714194Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07959","last_updated":"2025-02-01T09:30:34Z","snapshot_observed_at":"2026-08-13T01:25:02.967809Z","submitted_at":"2025-01-14T09:23:30Z","title":"Self-Instruct Few-Shot Jailbreaking: Decompose the Attack into Pattern and Behavior Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:35:52.714194Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.07959"},"observation_digest":"sha256:4a278c421a251ae25086098709800f989d2f0f8ab167b1814a81faf29c444910","observation_id":"6bb033e1-ce8e-48c9-a83d-809d6234bd9a","resolution":{"observed_at":"2026-08-10T20:35:52.714194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T20:15:11.764071Z","title":"Anwar, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09254","last_updated":"2025-01-16T02:43:44Z","snapshot_observed_at":"2026-08-13T06:35:26.129901Z","submitted_at":"2025-01-16T02:43:44Z","title":"Clone-Robust AI Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:15:11.764071Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.09254"},"observation_digest":"sha256:7db9d6e5309ff56069e84b97c5dcb591b680d40fa43c26dcad72dc2a4c9343b7","observation_id":"4a0ec520-0d0d-45c1-97ad-35ebf5e33ec5","resolution":{"observed_at":"2026-08-10T20:15:11.764071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T19:55:50.488108Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-13T04:40:45.853560Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T19:55:50.488108Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.09620"},"observation_digest":"sha256:fb7b91b40404f987cb49821f9e39a414bcd64745ed18891d39c438dd5bf1826a","observation_id":"e88b23e9-baaa-4345-a6a3-3101215e6698","resolution":{"observed_at":"2026-08-10T19:55:50.488108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T17:58:17.922278Z","title":"Foundational challenges in assuring alignment and safety of large langua ge models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11739","last_updated":"2025-01-22T15:09:02Z","snapshot_observed_at":"2026-08-13T20:39:25.734765Z","submitted_at":"2025-01-20T20:54:06Z","title":"Episodic memory in AI agents poses risks that should be studied and mitigated","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T17:58:17.922278Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.11739"},"observation_digest":"sha256:3e67c688958ec4faf8c0f31a5998282b7d09192a65158f6951afce3608b9d4a1","observation_id":"9a148bf4-fa45-45ed-9888-668ed4c51d37","resolution":{"observed_at":"2026-08-10T17:58:17.922278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T14:51:58.699740Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.14940","last_updated":"2026-06-28T22:17:10Z","snapshot_observed_at":"2026-08-10T14:57:28.038497Z","submitted_at":"2025-01-24T21:55:14Z","title":"CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T14:51:58.699740Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2501.14940"},"observation_digest":"sha256:a5d529af201a15b166e9ab6b38dcdbcf72277291d1423d767f8e9a5411cec465","observation_id":"926cd96f-cc6f-4f4b-ae9a-489852782b6f","resolution":{"observed_at":"2026-08-10T14:51:58.699740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-09T14:48:34.657585Z","title":"S., Jenner, E., Casper, S., Sourbut, O., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01635","last_updated":"2025-02-03T18:59:13Z","snapshot_observed_at":"2026-08-10T10:52:49.507908Z","submitted_at":"2025-02-03T18:59:13Z","title":"The AI Agent Index","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:48:34.657585Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2502.01635"},"observation_digest":"sha256:7a4e90f29a6d7944a67e5304a02ecf8a720320251446e72043315a1b9ad92926","observation_id":"2e708e35-c5da-4e6d-831e-ba710e2645fa","resolution":{"observed_at":"2026-08-09T14:48:34.657585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-09T05:09:16.102465Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04376","last_updated":"2025-02-05T16:25:43Z","snapshot_observed_at":"2026-08-10T00:16:25.433510Z","submitted_at":"2025-02-05T16:25:43Z","title":"MEETING DELEGATE: Benchmarking LLMs on Attending Meetings on Our Behalf","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T05:09:16.102465Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2502.04376"},"observation_digest":"sha256:4a9e0c9eaf5827255604342271953a2fc81eecb3b39ab2f674dba02df884aea1","observation_id":"0d821892-22fe-43fa-9cf9-a296911e69e9","resolution":{"observed_at":"2026-08-09T05:09:16.102465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-08T12:25:30.511215Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07557","last_updated":"2025-02-11T13:50:50Z","snapshot_observed_at":"2026-08-11T19:18:54.639349Z","submitted_at":"2025-02-11T13:50:50Z","title":"JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:30.511215Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2502.07557"},"observation_digest":"sha256:855128415e4bd14798a90bedf8ae413cb6eea226c4cf2d6d84b70d580b5d4284","observation_id":"67090237-d39b-4ec6-85bb-953388fac2cc","resolution":{"observed_at":"2026-08-08T12:25:30.511215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T19:45:20.088578Z","title":"Foundational challenges in assuring alignment and safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-12T22:07:51.112849Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:20.088578Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:42cb40051a7a756f1da928025cbdb938ede31e8dda49b8de7bd06c9a85975ad9","observation_id":"276b0fa3-77a0-4277-a525-fee2aa77b9ef","resolution":{"observed_at":"2026-08-07T19:45:20.088578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T14:30:04.428012Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18807","last_updated":"2025-05-24T17:41:47Z","snapshot_observed_at":"2026-08-11T07:37:54.093177Z","submitted_at":"2025-05-24T17:41:47Z","title":"Mitigating Deceptive Alignment via Self-Monitoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:30:04.428012Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.18807"},"observation_digest":"sha256:08bd705f22292bf5c8db75cf04ca0fdd1f0943b6c75ee1edcc0d33ea44b6546f","observation_id":"0c2bc9d3-9b3a-4bd8-a2df-7f37c0a94918","resolution":{"observed_at":"2026-08-07T14:30:04.428012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2505.19241","last_updated":"2026-05-14T18:01:35Z","snapshot_observed_at":"2026-08-12T14:46:49.151451Z","submitted_at":"2025-05-25T17:42:52Z","title":"ActiveDPO: Active Direct Preference Optimization for Sample-Efficient Alignment","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T01:06:19.756032Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.19241"},"observation_digest":"sha256:13ac7c4dc203ed502230797f142107e3e740bd39f831932db2075301fcaae372","observation_id":"eaaae2ea-aa11-4887-9fc5-b7df25e0b9b0","resolution":{"observed_at":"2026-05-22T01:10:51.554189Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T14:11:30.354244Z","title":"[Anwar et al., 2024] Usman Anwar, Abulhair Saparov, Javier Rando, Daniel Paleka, Miles Turpin, Peter Hase, Ekdeep Singh Lubana, Erik Jenner, Stephen Casper, Oliver Sourbut, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-13T17:46:04.448143Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.354244Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:3283a1b827fe760b886d3533d4483679c9a7aef2bc9689acbc310e9bcefc9e31","observation_id":"6604e4c7-4876-4fbf-a6c5-4753b52ba655","resolution":{"observed_at":"2026-08-07T14:11:30.354244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T12:40:13.874731Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24119","last_updated":"2025-05-30T01:32:44Z","snapshot_observed_at":"2026-08-07T23:14:32.953063Z","submitted_at":"2025-05-30T01:32:44Z","title":"The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:13.874731Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.24119"},"observation_digest":"sha256:12500d2ddb792e239f576283fe00ae972d170b0234d95f605372fe1d83632ba3","observation_id":"0d1cbc67-e62a-4ab9-8b73-d7ef4d75dfb6","resolution":{"observed_at":"2026-08-07T12:40:13.874731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T13:09:58.104897Z","title":"S., Jenner, E., Casper, S., Sourbut, O., Edelman, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00047","last_updated":"2025-05-28T16:52:44Z","snapshot_observed_at":"2026-08-07T13:01:23.937258Z","submitted_at":"2025-05-28T16:52:44Z","title":"Risks of AI-driven product development and strategies for their mitigation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:58.104897Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.00047"},"observation_digest":"sha256:ba7269f84e1c69d1cb1bb8327b5138cb66d6c1262105daa86192ac3cc679d709","observation_id":"75c56f71-475a-42c5-8fca-4ab6831a08d1","resolution":{"observed_at":"2026-08-07T13:09:58.104897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T11:17:28.039432Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02996","last_updated":"2025-06-03T15:31:00Z","snapshot_observed_at":"2026-08-08T03:16:36.105819Z","submitted_at":"2025-06-03T15:31:00Z","title":"Linear Spatial World Models Emerge in Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:17:28.039432Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.02996"},"observation_digest":"sha256:affc8d54ce40d24628a888222cbb3f2e14588b2abd16c0c7d687c317c706296c","observation_id":"6ffa341c-45b3-4e5d-9adc-c2fa387f1b01","resolution":{"observed_at":"2026-08-07T11:17:28.039432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T10:54:57.913128Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04018","last_updated":"2026-06-22T12:47:48Z","snapshot_observed_at":"2026-08-12T21:58:27.920961Z","submitted_at":"2025-06-04T14:46:47Z","title":"AgentMisalignment: Measuring the Propensity for Misaligned Behaviour in LLM-Based Agents","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:57.913128Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.04018"},"observation_digest":"sha256:aca03a0ce3a4a2bed836a44aa67b32397371eb1af0c7ba7ddd0b86d46ca69f65","observation_id":"e14fbc27-e4c3-4582-9af6-2e467cb1714f","resolution":{"observed_at":"2026-08-07T10:54:57.913128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T00:32:36.451035Z","title":"Foundational challenges in assuring alignment and safety of large language models.arXiv preprint arXiv:2404.09932, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13666","last_updated":"2025-06-16T16:24:31Z","snapshot_observed_at":"2026-08-07T00:25:36.770856Z","submitted_at":"2025-06-16T16:24:31Z","title":"We Should Identify and Mitigate Third-Party Safety Risks in MCP-Powered Agent Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:32:36.451035Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.13666"},"observation_digest":"sha256:95a61b9596816b581f074bef1fa895ef4afc323b0cd5ed7a180c6817134591bb","observation_id":"e62633f9-e83d-4a72-b74f-41265a3c4fd3","resolution":{"observed_at":"2026-08-07T00:32:36.451035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T23:49:13.094114Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16078","last_updated":"2025-06-19T07:03:05Z","snapshot_observed_at":"2026-08-07T07:58:06.769500Z","submitted_at":"2025-06-19T07:03:05Z","title":"Probing the Robustness of Large Language Models Safety to Latent Perturbations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T23:49:13.094114Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.16078"},"observation_digest":"sha256:62cef1609d1eb76ea499607503dea24adc9ccb259f7e5fa90dc250e76173ff93","observation_id":"28c35c6b-b441-4b2e-a413-138b5172816b","resolution":{"observed_at":"2026-08-06T23:49:13.094114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T21:58:22.466382Z","title":"Edelman, Zhaowei Zhang, Mario Günther, Anton Korinek, José Hernández-Orallo, Lewis Ham- mond, Eric J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22957","last_updated":"2025-08-27T20:38:04Z","snapshot_observed_at":"2026-08-12T00:00:00.258627Z","submitted_at":"2025-06-28T17:22:59Z","title":"Agent-to-Agent Theory of Mind: Testing Interlocutor Awareness among Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:22.466382Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2506.22957"},"observation_digest":"sha256:80c3f59b50279a39181efdd91251ce24cf83038746ca39374012534dcb975f67","observation_id":"555ad9b2-e220-459a-b447-9abe1b5f31e0","resolution":{"observed_at":"2026-08-06T21:58:22.466382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T19:07:40.377039Z","title":"S., Jenner, E., Casper, S., Sourbut, O., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06434","last_updated":"2025-07-08T22:29:06Z","snapshot_observed_at":"2026-08-08T23:28:38.307914Z","submitted_at":"2025-07-08T22:29:06Z","title":"Deprecating Benchmarks: Criteria and Framework","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:07:40.377039Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2507.06434"},"observation_digest":"sha256:6a0e963dab60198e396f01cbb06653b247ab4e1d2f38a5fb231ea5221e235ca4","observation_id":"d718aa0a-df81-4905-89ce-89b731533a5d","resolution":{"observed_at":"2026-08-06T19:07:40.377039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:56e9202c619a6508505c70fb21a06c4686311360f0183abe491489245f168e28","observation_id":"3e01fb38-ff2f-4f15-9450-db40c886c0bf","resolution":{"observed_at":"2026-05-14T22:23:15.423464Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T12:22:27.592346Z","title":"First, we have shown in section 3 that the downsides of racing to AGI are much higher than proponents of AGI Racing hold","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21839","last_updated":"2025-07-29T14:17:08Z","snapshot_observed_at":"2026-08-08T03:45:41.895034Z","submitted_at":"2025-07-29T14:17:08Z","title":"Against racing to AGI: Cooperation, deterrence, and catastrophic risks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:22:27.592346Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2507.21839"},"observation_digest":"sha256:ed607e65466450f1db79b214bf3ed3ce953742e2cec04fecb8ad44fc1f99d6c9","observation_id":"2e208163-7343-40e9-b35a-595ddf22ab0f","resolution":{"observed_at":"2026-08-06T12:22:27.592346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-06T11:34:24.795223Z","title":"Edelman, Zhaowei Zhang, Mario Günther, Anton Korinek, José Hernández-Orallo, Lewis Hammond, Eric J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22617","last_updated":"2025-07-30T12:37:29Z","snapshot_observed_at":"2026-08-13T07:40:27.787301Z","submitted_at":"2025-07-30T12:37:29Z","title":"Hate in Plain Sight: On the Risks of Moderating AI-Generated Hateful Illusions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:34:24.795223Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2507.22617"},"observation_digest":"sha256:99ba0ff0416c0fcdd5a18e1dab02024ad33dd666659c7928a834002de32edf44","observation_id":"372bda71-ed0d-4395-82e4-c3299076289b","resolution":{"observed_at":"2026-08-06T11:34:24.795223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T20:07:02.902944Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-13T17:29:23.195455Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.902944Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8c1ec0b505b76a455df47cbcc3479ebb4264f9a08a1084f09d2ed6b230cc527e","observation_id":"e0f6b72d-cb2b-44a1-a86b-39d5e21a3c38","resolution":{"observed_at":"2026-08-05T20:07:02.902944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T04:50:31.598124Z","title":"Foundational challenges in assuring alignment and safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05946","last_updated":"2025-09-07T06:46:03Z","snapshot_observed_at":"2026-08-12T11:27:02.882063Z","submitted_at":"2025-09-07T06:46:03Z","title":"Large Language Models for Next-Generation Wireless Network Management: A Survey and Tutorial","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T04:50:31.598124Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2509.05946"},"observation_digest":"sha256:ec02879a694544dd1390c58941d567432aac1017cbaaea5c9858f18592630b2f","observation_id":"ecc3fec7-e818-46c6-b563-51e46ebf87d9","resolution":{"observed_at":"2026-08-05T04:50:31.598124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2510.12826","last_updated":"2026-04-25T22:54:37Z","snapshot_observed_at":"2026-08-12T08:10:19.708249Z","submitted_at":"2025-10-11T04:42:29Z","title":"Scheming Ability in LLM-to-LLM Strategic Interactions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T07:50:30.597108Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2510.12826"},"observation_digest":"sha256:795cce14fc64a0e74ae95f0e40589ff4c36751e14d293b1084c5f2a86e8d2289","observation_id":"e8c68cc1-77b3-4e49-af8b-3d246cf85831","resolution":{"observed_at":"2026-05-18T07:51:03.750005Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-04T07:21:32.304935Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26707","last_updated":"2026-07-15T04:49:02Z","snapshot_observed_at":"2026-08-13T11:04:19.872401Z","submitted_at":"2025-10-30T17:09:09Z","title":"Value Drifts: Tracing Value Alignment During LLM Post-Training","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:32.304935Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2510.26707"},"observation_digest":"sha256:1c140a82e546c3ec46c15c9b5f886fdf171a4722e35c4c292db044f33368db09","observation_id":"c691439b-6c02-4607-97ce-bce0e5225742","resolution":{"observed_at":"2026-08-04T07:21:32.304935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-03T04:59:05.071079Z","title":"URL https: //doi.org/10.48550/arXiv.2404.09932","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.04899","last_updated":"2026-06-02T15:48:30Z","snapshot_observed_at":"2026-08-07T15:08:25.314163Z","submitted_at":"2026-02-03T14:38:07Z","title":"Phantom Transfer: Data Poisoning can Survive Data-Level Defences","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T04:59:05.071079Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2602.04899"},"observation_digest":"sha256:3f2d07e2bf432681427ff899df6707517909816cb5d37e8551e8da88ccc7f4aa","observation_id":"6777e281-4e8f-406e-9a6a-71c8f5b6d78c","resolution":{"observed_at":"2026-08-03T04:59:05.071079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2602.07340","last_updated":"2026-05-21T07:39:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-07T03:46:33Z","title":"Revisiting Robustness for LLM Safety Alignment via Selective Geometry Control","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T11:17:03.104902Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2602.07340"},"observation_digest":"sha256:e0765211c1b162444afd742b0a7b30a9f3d9e5b76ddd726bffce68cebd19fc8f","observation_id":"41cc4a35-8e10-49c1-a665-dadfb8cdaed7","resolution":{"observed_at":"2026-05-22T11:21:28.998865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-02T23:21:31.165458Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.14095","last_updated":"2026-07-06T07:40:26Z","snapshot_observed_at":"2026-08-12T21:04:26.529470Z","submitted_at":"2026-02-15T11:05:18Z","title":"NEST: Nascent Encoded Steganographic Thoughts","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T23:21:31.165458Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2602.14095"},"observation_digest":"sha256:8bf8187462ce8282b4dac546791a0a4c73c56b043ad5829d53e4720ff6c749b4","observation_id":"4bc4ceda-8734-4625-addb-79961c6c573b","resolution":{"observed_at":"2026-08-02T23:21:31.165458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2602.20102","last_updated":"2026-05-21T18:01:19Z","snapshot_observed_at":"2026-08-12T21:30:34.557997Z","submitted_at":"2026-02-23T18:19:46Z","title":"BarrierSteer: LLM Safety via Learning Barrier Steering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T07:02:03.058731Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2602.20102"},"observation_digest":"sha256:56524515eb3fc449de787f3e805ad01f81e73c480e25ba9ae971d49c15976df8","observation_id":"21fcd595-f29d-4fd0-8931-13f04dc59457","resolution":{"observed_at":"2026-05-25T07:05:26.712893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.05115","last_updated":"2026-05-06T16:46:03Z","snapshot_observed_at":"2026-08-07T10:12:24.411121Z","submitted_at":"2026-05-06T16:46:03Z","title":"Manifold Steering Reveals the Shared Geometry of Neural Network Representation and Behavior","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-05-08T17:47:09.591001Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.05115"},"observation_digest":"sha256:dffca0123ad5d0ace19f6ae562653559618e81bfd9ad989c05b23a1588fe2258","observation_id":"f1f45249-5e71-4b83-be97-9d66264b82b8","resolution":{"observed_at":"2026-05-11T17:16:06.543864Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.08405","last_updated":"2026-05-08T19:11:19Z","snapshot_observed_at":"2026-08-13T19:23:55.912371Z","submitted_at":"2026-05-08T19:11:19Z","title":"Belief or Circuitry? Causal Evidence for In-Context Graph Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T00:52:07.392800Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.08405"},"observation_digest":"sha256:9b3437475a0b6dcd15deb81f801987b2401537068fadea1f8c870469daf4bd7a","observation_id":"ffd801da-ca43-4ed6-b6f6-99f976febded","resolution":{"observed_at":"2026-05-12T08:41:23.962333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.11161","last_updated":"2026-05-11T19:08:21Z","snapshot_observed_at":"2026-08-11T19:23:54.346170Z","submitted_at":"2026-05-11T19:08:21Z","title":"Interpretability Can Be Actionable","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-13T06:12:51.656452Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.11161"},"observation_digest":"sha256:16b08a3cc6041df2883bba03bbf67ce8312a20fa498458f506c205f33cde3e66","observation_id":"2bcdda77-c8c6-4b91-8ba4-782e7a398082","resolution":{"observed_at":"2026-05-13T06:17:22.798229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.12412","last_updated":"2026-05-12T17:09:41Z","snapshot_observed_at":"2026-08-11T04:19:07.969715Z","submitted_at":"2026-05-12T17:09:41Z","title":"Stories in Space: In-Context Learning Trajectories in Conceptual Belief Space","version":1},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-05-13T05:17:34.283917Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.12412"},"observation_digest":"sha256:57212bd74df0c2887141108e17e0211f47fd55aadd5e0fd7f3c2187cdba7ced8","observation_id":"cf4c3b87-5ed5-45d5-b964-48f9624777db","resolution":{"observed_at":"2026-05-13T05:27:19.282765Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.29249","last_updated":"2026-05-28T02:09:38Z","snapshot_observed_at":"2026-08-13T00:23:09.386674Z","submitted_at":"2026-05-28T02:09:38Z","title":"Prediction-Powered Inference Across Many Tasks for AI Evaluation & Social Science Research","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T06:00:59.614364Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.29249"},"observation_digest":"sha256:168e7d78c69a694a6b090b6bfb569e8a96c6fbafb8569b65c0c8e0e56f595bea","observation_id":"e4284353-edd1-4007-8b40-4521a20c3b61","resolution":{"observed_at":"2026-06-29T06:03:08.437075Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.30169","last_updated":"2026-07-02T23:58:01Z","snapshot_observed_at":"2026-08-01T18:48:30.510137Z","submitted_at":"2026-05-28T16:20:19Z","title":"Dissociative Identity: Language Model Agents Lack Grounding for Reputation Mechanisms","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T00:26:54.019256Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.30169"},"observation_digest":"sha256:fa8eeadd5e5a8b1b7d67b0ce9537d6a38199216498496a3e21114469f96dfa38","observation_id":"b7dfc7f5-81bb-491b-ae4d-bf9f74b8ffa8","resolution":{"observed_at":"2026-06-29T00:32:53.047592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2605.30454","last_updated":"2026-05-28T18:26:40Z","snapshot_observed_at":"2026-08-12T14:46:06.128547Z","submitted_at":"2026-05-28T18:26:40Z","title":"The Surface You Test Is Not the Surface That Breaks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T06:37:19.674012Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2605.30454"},"observation_digest":"sha256:57010d9c557c4fa948992d26595c678b52aee00c69f9be21595848e33590843a","observation_id":"ca044699-010f-4031-944a-97e2aeaea091","resolution":{"observed_at":"2026-06-29T14:33:31.190683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.01929","last_updated":"2026-06-09T14:23:44Z","snapshot_observed_at":"2026-08-08T09:05:32.069117Z","submitted_at":"2026-06-01T08:59:03Z","title":"VET: A Framework for Analyzing AI Discourse","version":2},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-06-28T14:41:17.714421Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.01929"},"observation_digest":"sha256:96b1483c730029b2d6bdd3ffa149b3ef381510a55cabb9603e2c2e5eec30d0a8","observation_id":"ee43106b-6bdd-435c-b545-49b57857f71f","resolution":{"observed_at":"2026-07-01T23:06:20.479301Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.02211","last_updated":"2026-06-01T13:10:49Z","snapshot_observed_at":"2026-08-02T18:41:16.377453Z","submitted_at":"2026-06-01T13:10:49Z","title":"Consistency Training while Mitigating Obfuscation via Rate Matching","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-06-28T14:25:43.147442Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.02211"},"observation_digest":"sha256:e41d40a897de9c5fe1bd8c1e69569d35209823575897ef3892329870166737a0","observation_id":"fe12e385-1113-407c-b812-b8418590317b","resolution":{"observed_at":"2026-06-28T14:32:18.165223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.03647","last_updated":"2026-06-02T13:39:15Z","snapshot_observed_at":"2026-07-06T23:43:50.943530Z","submitted_at":"2026-06-02T13:39:15Z","title":"Black-box, Adaptive, Efficient, Transferable, Harmful, Applicable... Attacks Are All You Need to Break LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T09:21:57.373862Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.03647"},"observation_digest":"sha256:2fe906638754e8776e5de1a0d7096d80dcc54b77554d59a574acf068c91cdd52","observation_id":"2e78d5e7-5ce1-4849-b17c-6a011716ecbf","resolution":{"observed_at":"2026-07-02T04:16:34.761998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.07007","last_updated":"2026-06-05T07:52:43Z","snapshot_observed_at":"2026-08-12T17:17:53.375832Z","submitted_at":"2026-06-05T07:52:43Z","title":"A Geometric View for Understanding Concept Learning and Neuron Interpretation in Sparse Autoencoders","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:50.474397Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.07007"},"observation_digest":"sha256:bb4f9e09e60d2d383a486183ed8f989e96d6b2d14f275860d1e052d9b9fd4099","observation_id":"46a39709-f2b5-41aa-892b-53ffb6583773","resolution":{"observed_at":"2026-07-02T16:47:09.934660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.08381","last_updated":"2026-06-07T00:20:55Z","snapshot_observed_at":"2026-08-12T22:28:39.757023Z","submitted_at":"2026-06-07T00:20:55Z","title":"Auditing Proprietary Alignment in Large Language Models: A Comparative Framework Without a Ground-Truth Standard","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T19:04:07.735560Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.08381"},"observation_digest":"sha256:b31c37b07658244c1c8768ba1d2d98046dfbae0ea4844f4062536d49cc77c2bb","observation_id":"dcbdf9e3-9228-4c45-bb78-1a1947a62269","resolution":{"observed_at":"2026-07-02T22:17:26.017226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.09388","last_updated":"2026-06-08T12:03:51Z","snapshot_observed_at":"2026-08-13T14:47:40.331413Z","submitted_at":"2026-06-08T12:03:51Z","title":"Distilling Safe LLM Systems via Soft Prompts for On Device Settings","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-27T17:15:51.375580Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.09388"},"observation_digest":"sha256:819a670c5478857bfe458134342d3dabe1d2ae77d3e783d8c2aee31f60d15c35","observation_id":"5eb8546a-7b7b-4288-9804-0fd91738197e","resolution":{"observed_at":"2026-07-03T00:27:29.222546Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.09932","doi":"10.48550/arxiv.2404.09932","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Anwar, U., Saparov, A., Rando, J., Paleka, D., Turpin, M., Hase, P., Lubana, E","venue":"arXiv (Cornell University)","work_id":"da63c249-19b0-4d11-94bf-033eeaa2d43a","year":2024},"citing_paper":{"arxiv_id":"2606.22237","last_updated":"2026-06-20T21:37:12Z","snapshot_observed_at":"2026-08-06T06:38:36.041719Z","submitted_at":"2026-06-20T21:37:12Z","title":"Investigating The Security of Modern AI and Cloud Infrastructure","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T11:31:39.910784Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2606.22237"},"observation_digest":"sha256:9edd72673791f8926e223662e56dcabeace3834d6d62439eaf1c724d22092d54","observation_id":"e2cc9341-e13b-4344-aebc-f97c301d251d","resolution":{"observed_at":"2026-07-04T08:29:42.338587Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.209911+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-07-11T22:40:37.839133Z","title":"Foundational challenges in assuring alignment and safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03968","last_updated":"2026-07-09T20:41:05Z","snapshot_observed_at":"2026-08-13T02:35:48.611379Z","submitted_at":"2026-07-04T17:57:05Z","title":"Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T22:40:37.839133Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2607.03968"},"observation_digest":"sha256:3d7633330eae68abe09fd231da597a7cda251d0dfa935b22f728bdd2228d8ed3","observation_id":"2811f24f-910a-4c3e-b60d-9ea0d54caf92","resolution":{"observed_at":"2026-07-11T22:40:37.839133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-07-13T07:01:49.222325Z","title":"Foundational challenges in assuring alignment and safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03968","last_updated":"2026-07-09T20:41:05Z","snapshot_observed_at":"2026-08-13T02:35:48.611379Z","submitted_at":"2026-07-04T17:57:05Z","title":"Refused in Chat, Written in Code: Workflow-Level Jailbreak Construction in IDE Coding Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T07:01:49.222325Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2607.03968"},"observation_digest":"sha256:916220e1c41d9ad70e9970be4eb76db1a9f56317b9c25883ecd76b64b290dd29","observation_id":"580bb6d7-6b73-421a-b14f-02db6794d56d","resolution":{"observed_at":"2026-07-13T07:01:49.222325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-07-31T12:20:07.096313Z","title":"Foundational","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28282","last_updated":"2026-07-30T14:31:07Z","snapshot_observed_at":"2026-08-06T16:34:19.905250Z","submitted_at":"2026-07-30T14:31:07Z","title":"(Towards) Scalable Reliable Automated Evaluation with Large Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T12:20:07.096313Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2607.28282"},"observation_digest":"sha256:30f8cebaa6f191281f023983553f5e4c052523a9d9cbd75bb8ba2b1bad9ddcb9","observation_id":"078c6946-2dbb-4e66-bc77-84bc0ee45a14","resolution":{"observed_at":"2026-07-31T12:20:07.096313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-10T04:29:11.241994Z","title":"Foundational challenges in assuring alignment and safety of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07446","last_updated":"2026-08-07T17:33:09Z","snapshot_observed_at":"2026-08-12T23:13:00.553301Z","submitted_at":"2026-08-07T17:33:09Z","title":"Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:11.241994Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2608.07446"},"observation_digest":"sha256:776a3a23c7dac29d633052d252520397557ba7091e4cc4fd12d89db3a3826b32","observation_id":"b30a7b2d-a07f-4801-bbb5-93ca6fd4e08b","resolution":{"observed_at":"2026-08-10T04:29:11.241994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.09932/citation-record","integrity":"/paper/2404.09932/integrity","json":"/paper/2404.09932/citation-record.json","paper":"/paper/2404.09932"},"outbound":[],"paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T06:40:14.408726Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 64 inbound Pith citation observations for arXiv:2404.09932."}