{"as_of":"2026-08-09T13:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ef874e364231698b177b55f9b3194461533bcb4a2f283c13dbbc184e7b37b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":86,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T11:00:26.038752Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":12,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T23:50:35.737171Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04040","last_updated":"2025-05-30T09:43:42Z","snapshot_observed_at":"2026-08-08T23:43:13.905441Z","submitted_at":"2025-02-06T13:01:44Z","title":"Safety Reasoning with Guidelines","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T23:50:35.737171Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.04040"},"observation_digest":"sha256:745cf2771fc602c40161cbfcc5246be07c77fd7a6b81b644d281fe49faf3d811","observation_id":"db024240-ef8d-4c00-b3d5-d92dc678aa24","resolution":{"observed_at":"2026-08-08T23:50:35.737171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T19:15:54.849494Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., Chung, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05475","last_updated":"2025-02-08T07:24:04Z","snapshot_observed_at":"2026-08-09T02:15:12.668653Z","submitted_at":"2025-02-08T07:24:04Z","title":"You Are What You Eat -- AI Alignment Requires Understanding How Data Shapes Structure and Generalisation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T19:15:54.849494Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.05475"},"observation_digest":"sha256:52d2dc07b071c138ffc06df4acd23dde9b18cd08bfd27439c0842e7154125b9f","observation_id":"512edc13-4188-4aa5-84dc-413593bd86bc","resolution":{"observed_at":"2026-08-08T19:15:54.849494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T11:15:44.972604Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07985","last_updated":"2025-04-07T09:15:30Z","snapshot_observed_at":"2026-08-08T11:11:08.143477Z","submitted_at":"2025-02-11T22:06:25Z","title":"MetaSC: Test-Time Safety Specification Optimization for Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T11:15:44.972604Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.07985"},"observation_digest":"sha256:02dd5a6a523a2f260b44f550d3b087d48db98f1909746b166594530d0291151d","observation_id":"2022d310-a28d-4ce0-8134-f1ba8f434780","resolution":{"observed_at":"2026-08-08T11:15:44.972604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T05:42:43.386584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08301","last_updated":"2025-06-23T09:04:32Z","snapshot_observed_at":"2026-08-09T07:42:28.077349Z","submitted_at":"2025-02-12T11:02:59Z","title":"Compromising Honesty and Harmlessness in Language Models via Deception Attacks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:42:43.386584Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.08301"},"observation_digest":"sha256:2ff6930871a34db0655a41b2bf144b81812bb0624f7d07871935f56c1886dd6d","observation_id":"23fc67e0-3355-4317-b1f5-14535894b972","resolution":{"observed_at":"2026-08-08T05:42:43.386584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T23:14:41.674716Z","title":"Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Heylar, Rachel Dias, Andrea Vallone, Hongyu Ren, and Jason Wei","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08932","last_updated":"2025-02-13T03:29:42Z","snapshot_observed_at":"2026-08-09T10:42:17.568687Z","submitted_at":"2025-02-13T03:29:42Z","title":"On the Promise for Assurance of Differentiable Neurosymbolic Reasoning Paradigms","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:14:41.674716Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.08932"},"observation_digest":"sha256:3e64081f01f5f0b4af8daab134fb82d15b7a160e412b3b2157046e64e882f6ff","observation_id":"63c30fcf-e936-4b0b-bc26-23b50b978bfe","resolution":{"observed_at":"2026-08-07T23:14:41.674716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:268b32dee3e92508256d5bc87ccffcda13f1056ca6df35ee00cd52cd1a81b941","observation_id":"6ef9a4ad-f9b4-4eed-abe4-dde4c5d50bf1","resolution":{"observed_at":"2026-05-16T06:15:46.165967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2503.02574","last_updated":"2026-05-18T17:54:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-04T12:55:07Z","title":"LLM-Safety Evaluations Lack Robustness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T01:26:45.402983Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2503.02574"},"observation_digest":"sha256:b0587592ccb1ea305aab5dafce452f17108e141760235af21e62794a01ed9e16","observation_id":"797b4cde-8920-4277-8e1e-9c7bd552206a","resolution":{"observed_at":"2026-05-23T01:27:21.396795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-09T11:00:26.038752Z","title":"Preprint at urlhttps://arxiv.org/abs/2412.16339 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2503.04740","last_updated":"2025-02-05T02:13:57Z","snapshot_observed_at":"2026-08-09T10:55:36.133967Z","submitted_at":"2025-02-05T02:13:57Z","title":"PRISM: Perspective Reasoning for Integrated Synthesis and Mediation as a Multi-Perspective Framework for AI Alignment","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T11:00:26.038752Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2503.04740"},"observation_digest":"sha256:2a1140d219e159fc94ddb814a6e29705cf8a97d7ba43ad4004aea7c1ab19a09b","observation_id":"2891e1a8-293d-4598-b105-b252aa409e06","resolution":{"observed_at":"2026-08-09T11:00:26.038752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-21T07:24:12.845841Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2503.11926"},"observation_digest":"sha256:718dcfc74004d9e1b7fe117aa45ac2185c02804ae92aa752f83c2c48149d2b35","observation_id":"b5cb668e-a047-436e-8f98-c11c3d112395","resolution":{"observed_at":"2026-05-21T07:24:12.967449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T15:26:12.003241Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15242","last_updated":"2025-05-22T06:10:20Z","snapshot_observed_at":"2026-08-07T15:19:11.447714Z","submitted_at":"2025-05-21T08:18:41Z","title":"Adaptive Plan-Execute Framework for Smart Contract Security Auditing","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:26:12.003241Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.15242"},"observation_digest":"sha256:626aad1287310502abb3bd6ad98c4a920587406dc2971430a4b7e8e89fd0e2ca","observation_id":"736ec2ca-2f0d-4f7a-a40b-c03748cba596","resolution":{"observed_at":"2026-08-07T15:26:12.003241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:32:29.074711Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18556","last_updated":"2025-08-25T00:27:19Z","snapshot_observed_at":"2026-08-07T23:15:35.522697Z","submitted_at":"2025-05-24T06:47:32Z","title":"Exploring the Vulnerability of the Content Moderation Guardrail in Large Language Models via Intent Manipulation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:32:29.074711Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18556"},"observation_digest":"sha256:24bf4e4753933e4e2d1fff5440d6416a19452b800695183be0519ff647415ac1","observation_id":"a2b84897-36d2-4d2b-84ef-9eaac98ee83e","resolution":{"observed_at":"2026-08-07T14:32:29.074711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:27:03.474448Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18889","last_updated":"2025-08-24T03:15:13Z","snapshot_observed_at":"2026-08-08T20:47:09.765405Z","submitted_at":"2025-05-24T22:22:43Z","title":"Security Concerns for Large Language Models: A Survey","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:03.474448Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.18889"},"observation_digest":"sha256:315b025336ac0ab8321b98880ade1cdff289787603c2f8a0fc64a63f3899bc36","observation_id":"428190b1-bbfa-4d5d-bc45-1d9bbdbd8c59","resolution":{"observed_at":"2026-08-07T14:27:03.474448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:13:54.133916Z","title":"Deliberative alignment: Reasoning enables safer language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19690","last_updated":"2025-05-26T08:49:19Z","snapshot_observed_at":"2026-08-08T11:27:57.969115Z","submitted_at":"2025-05-26T08:49:19Z","title":"Beyond Safe Answers: A Benchmark for Evaluating True Risk Awareness in Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:13:54.133916Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.19690"},"observation_digest":"sha256:bbe148e60e8c7814fa204c634eea04f606869a76281a22eb2353426ad372df72","observation_id":"7c674e3d-7334-4773-91d8-1318731fe9a6","resolution":{"observed_at":"2026-08-07T14:13:54.133916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T14:00:05.091365Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-07T13:53:48.214686Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:05.091365Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:bcc4c55fedf5118311bb9afff96cde2abb873c8f2a235f242239a0317e50e0be","observation_id":"45941abb-072d-4929-8b1a-afb08a0d0b05","resolution":{"observed_at":"2026-08-07T14:00:05.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:45:30.366747Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint CoRR, abs/2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23646","last_updated":"2025-05-29T16:53:41Z","snapshot_observed_at":"2026-08-07T12:38:52.756749Z","submitted_at":"2025-05-29T16:53:41Z","title":"Are Reasoning Models More Prone to Hallucination?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:30.366747Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.23646"},"observation_digest":"sha256:cabbbd86e9ed25d8f5a932973ead9c9ec3721391befb78e6bb31aafb479f7549","observation_id":"a3316b4b-0177-4d54-a433-db6f8f99dade","resolution":{"observed_at":"2026-08-07T12:45:30.366747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:45:25.860418Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-07T23:13:48.148542Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:25.860418Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:774cec920b8680625c14bdd8c79203561f6ce0642781787189f5661d5a7c78c4","observation_id":"73fccd74-5a99-4ea2-acf7-9c161fd76513","resolution":{"observed_at":"2026-08-07T12:45:25.860418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:40:18.665783Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24119","last_updated":"2025-05-30T01:32:44Z","snapshot_observed_at":"2026-08-07T23:14:32.953063Z","submitted_at":"2025-05-30T01:32:44Z","title":"The State of Multilingual LLM Safety Research: From Measuring the Language Gap to Mitigating It","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:40:18.665783Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2505.24119"},"observation_digest":"sha256:2e2e50b8c5df1255fd3d1ddc30c8426da5395a0ee6c66af01c53870768e7f5b3","observation_id":"87506f66-df2f-47ce-a3e4-7b48fdf1c126","resolution":{"observed_at":"2026-08-07T12:40:18.665783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:13:21.052638Z","title":"https://arxiv.org/abs/2412.16339","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00242","last_updated":"2025-05-30T21:16:25Z","snapshot_observed_at":"2026-08-07T22:44:35.925402Z","submitted_at":"2025-05-30T21:16:25Z","title":"Whispers of Many Shores: Cultural Alignment through Collaborative Cultural Expertise","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:13:21.052638Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00242"},"observation_digest":"sha256:74f351aeba711fa3c551cd7d7dadc231443a8320c70594f7eadf4e5dc7be02d9","observation_id":"0764566c-4bae-4790-a32f-5248f95636f0","resolution":{"observed_at":"2026-08-07T12:13:21.052638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:14:26.266557Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00307","last_updated":"2025-08-20T23:19:57Z","snapshot_observed_at":"2026-08-07T16:06:15.633861Z","submitted_at":"2025-05-30T23:32:57Z","title":"Lossless Token Sequence Compression via Meta-Tokens","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:14:26.266557Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00307"},"observation_digest":"sha256:090c87b0a2e747ed8e8e063412aaf70878086968d7f6e90c950ce2ae7653245e","observation_id":"9d95336f-2acc-4672-83ab-f461671f1728","resolution":{"observed_at":"2026-08-07T12:14:26.266557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:10:30.276451Z","title":"InProceedings of the 17th International Conference on Mining Software Repositories, MSR ’20, page 508–512, New York, NY , USA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00419","last_updated":"2025-09-10T16:01:21Z","snapshot_observed_at":"2026-08-09T06:54:29.517411Z","submitted_at":"2025-05-31T06:48:12Z","title":"Teaching an Old LLM Secure Coding: Localized Preference Optimization on Distilled Preferences","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:30.276451Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.00419"},"observation_digest":"sha256:f639b659386a6a75ff62a23a832fce7973cba858d48c25aa082f84e136e5a749","observation_id":"0573b213-1033-4801-bd25-b42495bbc261","resolution":{"observed_at":"2026-08-07T12:10:30.276451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T12:11:19.235153Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05376","last_updated":"2025-06-09T05:48:22Z","snapshot_observed_at":"2026-08-07T12:39:09.825243Z","submitted_at":"2025-05-30T22:58:54Z","title":"A Red Teaming Roadmap Towards System-Level Safety","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:11:19.235153Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.05376"},"observation_digest":"sha256:c120382de10ca2498ab0e13f2633268ce91747df411b733a33f042db948e65d7","observation_id":"567b6b7a-433b-4046-8802-41b02ea292ce","resolution":{"observed_at":"2026-08-07T12:11:19.235153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T05:19:00.051825Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08399","last_updated":"2025-06-11T06:57:37Z","snapshot_observed_at":"2026-08-08T08:31:17.317755Z","submitted_at":"2025-06-10T03:13:50Z","title":"SafeCoT: Improving VLM Safety with Minimal Reasoning","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:19:00.051825Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.08399"},"observation_digest":"sha256:13a7fb76639757951bfb3f7fb6294c20d7efd31096bfe6f57409d08d9746e6ab","observation_id":"d690aabc-7d87-4f24-929f-34c3c953e1ee","resolution":{"observed_at":"2026-08-07T05:19:00.051825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T01:02:28.553458Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12274","last_updated":"2025-06-13T23:03:11Z","snapshot_observed_at":"2026-08-09T00:29:06.890225Z","submitted_at":"2025-06-13T23:03:11Z","title":"InfoFlood: Jailbreaking Large Language Models with Information Overload","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T01:02:28.553458Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.12274"},"observation_digest":"sha256:444f7e602b2b3b805164db0fd57a9f415a717a4608d1f9411d5e365556d4c618","observation_id":"a952a564-86e3-4215-84b1-0e5002fc8b9b","resolution":{"observed_at":"2026-08-07T01:02:28.553458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T00:15:00.611082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14922","last_updated":"2025-06-24T19:55:23Z","snapshot_observed_at":"2026-08-07T04:49:42.432527Z","submitted_at":"2025-06-17T19:08:02Z","title":"FORTRESS: Frontier Risk Evaluation for National Security and Public Safety","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:00.611082Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2506.14922"},"observation_digest":"sha256:dd0a338fc44399ef619f85f3bdfac0b4440906fc4f6a80e3f6ed544c1325c08c","observation_id":"f2513c89-8d5f-42a1-a973-4811b3530d72","resolution":{"observed_at":"2026-08-07T00:15:00.611082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T21:50:24.108617Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., Chung, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-07T23:14:25.004427Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.108617Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:7e411a76b3e0ff5809feb3badde8d165da9404e5efc67c6ae6244c23387a8de2","observation_id":"d78fe336-7b68-4781-a6de-0a99ff02065d","resolution":{"observed_at":"2026-08-06T21:50:24.108617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T18:47:19.985383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07441","last_updated":"2025-08-20T22:10:48Z","snapshot_observed_at":"2026-08-09T10:40:54.885700Z","submitted_at":"2025-07-10T05:38:15Z","title":"SAND: Boosting LLM Agents with Self-Taught Action Deliberation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T18:47:19.985383Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.07441"},"observation_digest":"sha256:886e02b51baf300166b6699b9536707cd5521fbf438351f180db7d06825b8c50","observation_id":"e922bb64-c738-4675-aed0-39776862d27a","resolution":{"observed_at":"2026-08-06T18:47:19.985383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-07T00:23:17.986195Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shi- rong Ma, Peiyi Wang, Xiao Bi, and 1 others","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-08T13:44:26.014435Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:17.986195Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:1b8e575099ecddbb6a8d8336e26e0f433755785bd1cb628544b22dcf37b2c0b1","observation_id":"209be614-bf2f-4e4a-8152-18d0bb36ce4b","resolution":{"observed_at":"2026-08-07T00:23:17.986195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T15:53:17.551777Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14805","last_updated":"2025-07-20T03:51:13Z","snapshot_observed_at":"2026-08-07T11:42:09.990444Z","submitted_at":"2025-07-20T03:51:13Z","title":"Subliminal Learning: Language models transmit behavioral traits via hidden signals in data","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T15:53:17.551777Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.14805"},"observation_digest":"sha256:d28b1e8f362bca26051796a575e8e6c512b49f3e3a3bfdf61847294ee52831e3","observation_id":"efeff014-0da3-4387-89e2-6fc3a28658e7","resolution":{"observed_at":"2026-08-06T15:53:17.551777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T15:48:01.386002Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14987","last_updated":"2025-07-20T14:47:03Z","snapshot_observed_at":"2026-08-07T23:14:33.627711Z","submitted_at":"2025-07-20T14:47:03Z","title":"AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T15:48:01.386002Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.14987"},"observation_digest":"sha256:f41d99b24bd5c54f02d988d34a11c6e064bea0fca43fbb615d1a1a70c7aa220d","observation_id":"449e52f3-1076-4415-b5b0-64a3b80315c0","resolution":{"observed_at":"2026-08-06T15:48:01.386002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T14:13:07.297537Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.297537Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:960cce86b45b05902221e9b90b4594c004474361e6dabaebfb874f2f31a9741f","observation_id":"415de428-35f3-4565-9940-7ce12511a372","resolution":{"observed_at":"2026-08-06T14:13:07.297537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T12:17:38.663630Z","title":"arXiv preprint arXiv:2412.16339 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21929","last_updated":"2025-07-29T15:45:50Z","snapshot_observed_at":"2026-08-08T06:52:31.839753Z","submitted_at":"2025-07-29T15:45:50Z","title":"Libra: Large Chinese-based Safeguard for AI Content","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:17:38.663630Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.21929"},"observation_digest":"sha256:52d15dc512ddfb12a46d27009df9b45e825de323be98dc461765cb99595fc76f","observation_id":"7b23d923-fb9a-45b2-9e6d-cf79ef6937c9","resolution":{"observed_at":"2026-08-06T12:17:38.663630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T10:18:24.466989Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00324","last_updated":"2025-08-01T05:14:13Z","snapshot_observed_at":"2026-08-07T21:57:02.982200Z","submitted_at":"2025-08-01T05:14:13Z","title":"R1-ACT: Efficient Reasoning Model Safety Alignment by Activating Safety Knowledge","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T10:18:24.466989Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.00324"},"observation_digest":"sha256:b92d2b8c18739d63b0c78ec4df76337ef92af133980d210ce4eda25dd5d73d96","observation_id":"a5a3d952-e6d6-49f3-a72c-8cf9204b488b","resolution":{"observed_at":"2026-08-06T10:18:24.466989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T04:47:25.538461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-08T05:44:09.712429Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.538461Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:8ec62dfed2cf207c96bef54dbee93dbe7dfce3cb73fcbc8893e856d73d962d51","observation_id":"078762c1-6d06-4376-85a0-197877d02b1d","resolution":{"observed_at":"2026-08-06T04:47:25.538461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T01:03:50.244026Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03933","last_updated":"2025-08-05T21:55:14Z","snapshot_observed_at":"2026-08-07T23:14:31.511391Z","submitted_at":"2025-08-05T21:55:14Z","title":"Towards terahertz nanomechanics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T01:03:50.244026Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03933"},"observation_digest":"sha256:5fe477f4ad23429b612b94e84bac6ce312aa86946bdca776a7d3f6cace29a32a","observation_id":"ef1a2ba5-1e30-4db3-88ed-19856cf9274d","resolution":{"observed_at":"2026-08-06T01:03:50.244026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T01:04:33.591580Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03936","last_updated":"2025-08-05T21:57:52Z","snapshot_observed_at":"2026-08-08T12:25:04.397522Z","submitted_at":"2025-08-05T21:57:52Z","title":"ASTRA: Autonomous Spatial-Temporal Red-teaming for AI Software Assistants","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T01:04:33.591580Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.03936"},"observation_digest":"sha256:368bd1e3fdca31c93574f8f52e1c074e3ad663a7326e0b380fa1d35afc55da3c","observation_id":"7ef559a2-84e8-49b2-81d8-62ea5359e245","resolution":{"observed_at":"2026-08-06T01:04:33.591580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T23:23:31.962576Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05432","last_updated":"2025-08-07T14:21:33Z","snapshot_observed_at":"2026-08-06T11:13:03.566935Z","submitted_at":"2025-08-07T14:21:33Z","title":"Whose Truth? Pluralistic Geo-Alignment for (Agentic) AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:23:31.962576Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.05432"},"observation_digest":"sha256:d03ac6500d60edf9f0e46dfb999de8867218404bba3d5c44e848883db721a476","observation_id":"a1c86dd5-b54c-4c70-b9d3-856187e3ec0a","resolution":{"observed_at":"2026-08-05T23:23:31.962576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T12:22:54.633089Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.10925"},"observation_digest":"sha256:14603f33c64c4f0d936e6e87c6bc505cccf4c5acf1dc116a10faf4dbeff1bc54","observation_id":"11e7454a-7858-43d9-98a1-03d479d9b806","resolution":{"observed_at":"2026-05-10T12:22:54.679028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T15:20:14.188064Z","title":"arXiv preprint arXiv:2412.16339","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20151","last_updated":"2025-08-27T16:47:31Z","snapshot_observed_at":"2026-08-07T23:13:46.567117Z","submitted_at":"2025-08-27T16:47:31Z","title":"IntentionReasoner: Facilitating Adaptive LLM Safeguards through Intent Reasoning and Selective Query Refinement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:20:14.188064Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2508.20151"},"observation_digest":"sha256:caa776882a43be744c10fdfe03c90a7a4616cc3a348f970b19df865f31d0bf9a","observation_id":"80137bcd-470a-400a-b79a-4e705dcc8b32","resolution":{"observed_at":"2026-08-05T15:20:14.188064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T12:52:54.701047Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01186","last_updated":"2025-09-01T07:10:22Z","snapshot_observed_at":"2026-08-07T23:29:49.490186Z","submitted_at":"2025-09-01T07:10:22Z","title":"Statutory Construction and Interpretation for Artificial Intelligence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T12:52:54.701047Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.01186"},"observation_digest":"sha256:61b37abf0e174974696789647a0e1df718fbd19d4abebc03b2f1c57a068bc2ec","observation_id":"73b85185-a26e-4f6f-abc8-c828b1299b94","resolution":{"observed_at":"2026-08-05T12:52:54.701047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T10:39:07.027988Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:07.027988Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:510fdebb8b38b78d1bdd433133ce4454f36fd152e931488149953d6852e30b01","observation_id":"717369dd-b535-4414-a90e-5ed197e818ed","resolution":{"observed_at":"2026-08-05T10:39:07.027988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2509.05367","last_updated":"2026-05-30T08:23:37Z","snapshot_observed_at":"2026-08-05T10:36:13.650340Z","submitted_at":"2025-09-04T05:53:20Z","title":"Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T19:36:23.882344Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.05367"},"observation_digest":"sha256:2f09cdeb25d60491243a83f75191058f57a6680f21c10584f1cd5a8a64a04624","observation_id":"f910b908-634e-4eb7-8108-e78f6441d5d2","resolution":{"observed_at":"2026-05-18T19:36:47.435169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T10:36:15.617560Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05367","last_updated":"2026-05-30T08:23:37Z","snapshot_observed_at":"2026-08-05T10:36:13.650340Z","submitted_at":"2025-09-04T05:53:20Z","title":"Between a Rock and a Hard Place: The Tension Between Ethical Reasoning and Safety Alignment in LLMs","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:15.617560Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.05367"},"observation_digest":"sha256:b154efe2f7db159d64247bdd6a18baae98be3a0da9824d0e1d151bb74b36dadb","observation_id":"812cb2d2-f762-48b8-92ff-288ab0b62199","resolution":{"observed_at":"2026-08-05T10:36:15.617560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-04T14:43:49.835349Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.23694","last_updated":"2026-06-03T04:13:57Z","snapshot_observed_at":"2026-08-04T14:43:33.365212Z","submitted_at":"2025-09-28T07:05:17Z","title":"SafeSearch: Automated Red-Teaming of LLM-Based Search Agents","version":6},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:49.835349Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2509.23694"},"observation_digest":"sha256:450fca99205b8e60f038dad3b45dcaff95698e6a29c0d4e58fd7eeb5b8113f04","observation_id":"7661fd46-165e-4792-9ccc-10ba8412cae6","resolution":{"observed_at":"2026-08-04T14:43:49.835349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-04T07:07:52.834565Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.04694","last_updated":"2026-07-01T16:09:28Z","snapshot_observed_at":"2026-08-04T07:07:51.334462Z","submitted_at":"2025-10-30T22:13:31Z","title":"Reasoning Up the Instruction Ladder for Controllable Language Models","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T07:07:52.834565Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2511.04694"},"observation_digest":"sha256:349c9e5f5ffd7a7177ebf8c7c0ac655445d2ef9015538dcf081d4dfed43a6071","observation_id":"ce52139d-2018-4134-8251-1252b0e2ce92","resolution":{"observed_at":"2026-08-04T07:07:52.834565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2602.07892","last_updated":"2026-05-12T03:21:50Z","snapshot_observed_at":"2026-07-06T22:45:00.816348Z","submitted_at":"2026-02-08T09:53:46Z","title":"Safety Alignment as Continual Learning: Mitigating the Alignment Tax via Orthogonal Gradient Projection","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:17.785715Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2602.07892"},"observation_digest":"sha256:a4653dcd82b3d2082aed85763fca9294ec42c9e317ad853192645243e53145e6","observation_id":"76760757-a24b-4d92-be01-fe907de2fc53","resolution":{"observed_at":"2026-05-16T06:40:42.343205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2603.17305","last_updated":"2026-05-19T16:22:05Z","snapshot_observed_at":"2026-07-06T22:49:28.866886Z","submitted_at":"2026-03-18T03:00:42Z","title":"Contrastive Reasoning Alignment: Reinforcement Learning from Hidden Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T11:23:26.852673Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2603.17305"},"observation_digest":"sha256:1e5ac803d7516bb9e30583485130c8a416e2ddcadcf9aaf25be9d5d3ef18a3bd","observation_id":"b26cf182-2e61-46b3-a1f3-1629fa03bffc","resolution":{"observed_at":"2026-05-21T11:24:08.445919Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.05339","last_updated":"2026-04-07T02:23:48Z","snapshot_observed_at":"2026-07-06T22:54:04.491386Z","submitted_at":"2026-04-07T02:23:48Z","title":"Human Values Matter: Investigating How Misalignment Shapes Collective Behaviors in LLM Agent Communities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:52:16.543718Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.05339"},"observation_digest":"sha256:33c20005329d31443c10718ff99022324071e46fd2d82c49816f977ad27dc55e","observation_id":"ed444e7a-71c3-4c47-a1fc-47ab4227d11f","resolution":{"observed_at":"2026-05-10T22:25:51.877085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-08T15:29:11.222219Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:50.762366Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:b35259f5bd239a9ca2463e5d0b5e503ecaa4c39228fbe85870968d0f1c63bf8a","observation_id":"414ce9e4-f3f5-49b9-a2fe-8e74c4f7c7a2","resolution":{"observed_at":"2026-05-11T09:56:03.213083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T00:19:56.880861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.12088","last_updated":"2026-07-30T19:39:21Z","snapshot_observed_at":"2026-08-08T15:29:11.222219Z","submitted_at":"2026-04-13T21:52:57Z","title":"Think Before You Code: Dual Reasoning for the NLSafety-Utility Trade-Off in LLM Code Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:19:56.880861Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.12088"},"observation_digest":"sha256:f3bca9d61e7c19b061a0c3eb61d278c6b7a24eb2c8a800b3d4c48e794c9c2246","observation_id":"26d3d840-1830-414c-9e64-2f30f50431db","resolution":{"observed_at":"2026-08-03T00:19:56.880861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.16654","last_updated":"2026-04-21T17:02:41Z","snapshot_observed_at":"2026-08-02T19:26:51.122713Z","submitted_at":"2026-04-17T19:19:57Z","title":"IYKYK (But AI Doesn't): Automated Content Moderation Does Not Capture Communities' Heterogeneous Attitudes Towards Reclaimed Language","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T08:19:50.909364Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.16654"},"observation_digest":"sha256:ad8b3e53e7cb1424525ad6c337cdd91646f4fd826cf8f280bd48b5200facd5b9","observation_id":"f5fbc12d-ebfa-4525-a4d1-a21615b3988b","resolution":{"observed_at":"2026-05-10T08:22:37.099023Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T05:48:44.687520Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.17596"},"observation_digest":"sha256:34e4f9f31fb0cce823e353711036f960af065075114a8bc3fb7628bbbeecbee1","observation_id":"17fe05f8-fa6c-4f9a-957e-3e1ef5b721d5","resolution":{"observed_at":"2026-05-10T05:51:10.098655Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2604.18946","last_updated":"2026-04-21T00:50:13Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:50:13Z","title":"Reasoning Structure Matters for Safety Alignment of Reasoning Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T02:36:57.093584Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2604.18946"},"observation_digest":"sha256:a01db373e803b8221e7accf44be7097187dc8f2bb2b49fef44a3ee5c14e8d2d1","observation_id":"27bc220b-5f2e-4b0e-8fcc-df1df3f8a7af","resolution":{"observed_at":"2026-05-11T12:56:04.339490Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.03900","last_updated":"2026-05-05T15:55:19Z","snapshot_observed_at":"2026-07-06T23:16:44.876986Z","submitted_at":"2026-05-05T15:55:19Z","title":"Contextual Multi-Objective Optimization: Rethinking Objectives in Frontier AI Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T16:26:04.152045Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.03900"},"observation_digest":"sha256:74f03a8080b19ef9940f54ddab427aec4b347345a0d467cbbeeb3a5a14d8fb40","observation_id":"c8701d36-fcba-4409-85cc-d5bb4047210b","resolution":{"observed_at":"2026-05-11T23:41:18.981416Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T11:17:19.079380Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:b547a94174096607660f4570f91f649df0ed0f441a374b36c5f22c62d57debb6","observation_id":"e64a7095-35c2-462c-b0ae-e9560148d988","resolution":{"observed_at":"2026-05-11T19:41:09.007290Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05630","last_updated":"2026-05-12T16:52:21Z","snapshot_observed_at":"2026-08-02T19:44:06.033074Z","submitted_at":"2026-05-07T03:35:31Z","title":"One Turn Too Late: Response-Aware Defense Against Hidden Malicious Intent in Multi-Turn Dialogue","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T07:53:06.928500Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05630"},"observation_digest":"sha256:c327e792b83caf6243ea829fc00932de3454ca23bfcd9969caaecce6ab545993","observation_id":"e132bfc6-f458-4968-bb02-2054c8aeab10","resolution":{"observed_at":"2026-05-13T07:57:31.670860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-02T07:12:00.817422Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:6f0f44d2965dd938aaec377d3bf5aca1c759780d154eea339745a6ee3f6cb92c","observation_id":"35d8e2ed-d827-4192-9da9-8eaedc0b0e00","resolution":{"observed_at":"2026-05-11T19:31:08.576351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.08930","last_updated":"2026-05-09T13:05:00Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:05:00Z","title":"Internalizing Safety Understanding in Large Reasoning Models via Verification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T01:50:59.283409Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.08930"},"observation_digest":"sha256:7ffe32789d63c6a662c0d0c3f819bb6edefceaa36993e42d87a02747b1bff6f7","observation_id":"479779e5-6147-404b-84aa-3e672a7f678a","resolution":{"observed_at":"2026-05-12T01:51:14.318720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.23565","last_updated":"2026-05-22T12:31:18Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:31:18Z","title":"Understanding Goal Generalisation in Sequential Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-25T04:49:50.034743Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.23565"},"observation_digest":"sha256:2d1279a63b0fde6f1e91fb48f35de13ddadb3ffb246f0ffc96f2e11fb43ed0af","observation_id":"272fc79d-4ef2-4ae5-ba07-222ec5920666","resolution":{"observed_at":"2026-05-25T04:50:20.921471Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.24229","last_updated":"2026-05-22T21:17:16Z","snapshot_observed_at":"2026-08-07T11:18:28.951204Z","submitted_at":"2026-05-22T21:17:16Z","title":"How Well Do Models Follow Their Constitutions?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T15:33:43.569710Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.24229"},"observation_digest":"sha256:5bcac11571fece275292315031077ff9b4a8d3d5048124e42da3993887545bd3","observation_id":"7f4d29f4-5a4d-4ba7-a7c7-0bbc2ddd70f1","resolution":{"observed_at":"2026-06-30T15:34:47.874528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.24834","last_updated":"2026-05-24T02:58:21Z","snapshot_observed_at":"2026-08-09T04:47:55.939608Z","submitted_at":"2026-05-24T02:58:21Z","title":"Reflect-Guard: Enhancing LLM Safeguards against Adversarial Prompts via Logical Self-Reflection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T00:29:50.433221Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.24834"},"observation_digest":"sha256:fbcb60d2eb794823a9e8151e4e2a14ff96ef4ca90411e6f5b512ed3c37f01c25","observation_id":"cdfbb531-120e-466a-b884-6941277f5414","resolution":{"observed_at":"2026-07-01T16:35:50.610720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2605.28467","last_updated":"2026-05-27T13:33:26Z","snapshot_observed_at":"2026-08-05T22:05:24.662345Z","submitted_at":"2026-05-27T13:33:26Z","title":"Mitigating Adaptive Attacks against Reasoning Models with Activation Consistency Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T14:18:16.033063Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2605.28467"},"observation_digest":"sha256:45edc12d35594db0d7b764dc7db0e8e0c964c8abd821361420af70493f74ee8e","observation_id":"ba830e08-2ec1-429e-ba58-0d5e4ad252e6","resolution":{"observed_at":"2026-06-29T14:23:30.706723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.06840","last_updated":"2026-06-05T02:32:24Z","snapshot_observed_at":"2026-08-05T15:03:33.373071Z","submitted_at":"2026-06-05T02:32:24Z","title":"Characterize Then Distill: Mechanistic Reasoning in Large Output Spaces","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-06-27T22:22:52.690010Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.06840"},"observation_digest":"sha256:7eaed76616aaf73da29047cca904357f9c6001d138b3b11843606981735ed101","observation_id":"261b5b94-bf0f-4a3a-b4cb-96c188b31576","resolution":{"observed_at":"2026-06-27T22:31:21.526096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.08682","last_updated":"2026-06-07T15:34:59Z","snapshot_observed_at":"2026-08-06T16:55:07.383031Z","submitted_at":"2026-06-07T15:34:59Z","title":"Activation Steering Induces Emergent Misalignment: A More Comprehensive Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T18:35:21.388956Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.08682"},"observation_digest":"sha256:af47313d9297322e43b0e858c688bc8410109431388bb9a6339d0ed3fddd6bee","observation_id":"9967d366-91e4-4062-8624-8761f1e45cc6","resolution":{"observed_at":"2026-07-02T22:57:26.124147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":244,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:382752e6dc64842465cc8e63eed21c7a77420bd13116920bec56fc5fbd0b2570","observation_id":"0a3bd05e-3e5b-42b0-866e-0586952688a2","resolution":{"observed_at":"2026-07-03T01:37:30.453603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.15531","last_updated":"2026-06-16T14:29:31Z","snapshot_observed_at":"2026-08-08T06:11:28.037599Z","submitted_at":"2026-06-14T01:18:53Z","title":"Greedy Coordinate Diffusion: Effective and Semantically Coherent Adversarial Attacks via Diffusion Guidance","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T04:35:35.594085Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.15531"},"observation_digest":"sha256:51b4e45fd5fdc7e32147a1a57cbcfbd15cb1ebc45dbb1b333b6c04fe9bdd891c","observation_id":"bd46bb0c-007c-4699-a9ec-b322b81061fc","resolution":{"observed_at":"2026-07-03T17:08:43.430699Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.20470","last_updated":"2026-06-26T21:12:34Z","snapshot_observed_at":"2026-08-06T05:00:49.716669Z","submitted_at":"2026-06-18T16:50:28Z","title":"Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:04:38.863201Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.20470"},"observation_digest":"sha256:ba94f24c07c7f9d750e77778db917b4c7f5715e91aaeeab9c0340015661ee551","observation_id":"adb4d015-68ac-43f9-bbdb-4708714ccbe5","resolution":{"observed_at":"2026-07-04T04:19:34.767260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.20470","last_updated":"2026-06-26T21:12:34Z","snapshot_observed_at":"2026-08-06T05:00:49.716669Z","submitted_at":"2026-06-18T16:50:28Z","title":"Analyzing Defensive Misdirection Against Model-Guided Automated Attacks on Agentic AI Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T10:30:03.047181Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.20470"},"observation_digest":"sha256:008b7be99a9a91185eb52f4e8e282f331e347b7db4f7a66cf915c84e7fae6af4","observation_id":"043c0c62-8bf8-42ae-b1ee-ea97acc3187d","resolution":{"observed_at":"2026-06-30T10:34:36.560267Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.25013","last_updated":"2026-06-23T17:59:01Z","snapshot_observed_at":"2026-08-03T16:39:59.297765Z","submitted_at":"2026-06-23T17:59:01Z","title":"Do Thinking Tokens Help with Safety?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-25T23:37:49.412578Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.25013"},"observation_digest":"sha256:f37ab94cfb21298ce2eb517e76818ee49aff23017884720ed433fd6a60acbf66","observation_id":"125b2c5f-13ce-4795-8bb9-9e81e6ad67a1","resolution":{"observed_at":"2026-07-04T17:30:00.639214Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.25442","last_updated":"2026-06-24T06:10:33Z","snapshot_observed_at":"2026-08-07T08:27:53.838717Z","submitted_at":"2026-06-24T06:10:33Z","title":"PolicyAlign: Direct Policy-Based Safety Alignment for Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-25T21:09:19.727723Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.25442"},"observation_digest":"sha256:6dfe589736184d8ed3aae632ab75a7cbdc0ef0d656d940d6ff9e5ce94ac02a26","observation_id":"8e26d784-e1d1-4784-a47d-feedb03f575d","resolution":{"observed_at":"2026-07-04T19:40:06.722457Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2606.28739","last_updated":"2026-06-27T05:26:43Z","snapshot_observed_at":"2026-08-08T08:45:01.144647Z","submitted_at":"2026-06-27T05:26:43Z","title":"Agent Safety Is Action Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T09:50:45.759936Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2606.28739"},"observation_digest":"sha256:bc878f2b8d231ab5a8d7ee114dda9f38f559e94e03b1580956ffe5ec60918b38","observation_id":"872dc00c-6b2b-4f47-8a70-0014c8a804a7","resolution":{"observed_at":"2026-06-30T09:54:35.001200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T12:57:00.805343Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:df10249bfdd386b2959a883680be90d2b6ae52a7c5791ad8bf3dd0666321d836","observation_id":"1d0be5d4-c9cd-4fef-8161-6bc4d6f3d461","resolution":{"observed_at":"2026-07-02T13:06:58.846398Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T09:27:01.450708Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.00572","last_updated":"2026-07-08T05:02:03Z","snapshot_observed_at":"2026-07-12T09:27:00.586335Z","submitted_at":"2026-07-01T07:58:16Z","title":"HARC: Coupling Harmfulness and Refusal Directions for Robust Safety Alignment","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T09:27:01.450708Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.00572"},"observation_digest":"sha256:09290d815f593d5d18260d0058800475db6f3c9b3a6c8b9fdb916f9fd348ddc3","observation_id":"9b2a054d-3b7f-4ee8-bccf-a3d47cd92f47","resolution":{"observed_at":"2026-07-12T09:27:01.450708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":"2412.16339","doi":"10.48550/arxiv.2412.16339","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Y ., Joglekar, M., Wallace, E., Jain, S., Barak, B., Heylar, A., Dias, R., Vallone, A., Ren, H., Wei, J., et al","venue":"arXiv (Cornell University)","work_id":"900d0032-4aa1-4b47-ab57-616164d48b88","year":2024},"citing_paper":{"arxiv_id":"2607.01277","last_updated":"2026-07-01T06:36:29Z","snapshot_observed_at":"2026-08-05T18:03:53.977353Z","submitted_at":"2026-07-01T06:36:29Z","title":"Cognitive Firewall: A Proactive, Zero-Trust, Multi-Gate Framework for LLM Safety","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T20:38:16.610310Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.01277"},"observation_digest":"sha256:9cf032c0ec2e7796f5cb3473af8ecae31286eaa06a937c5660dd439488a7f132","observation_id":"c34d92c6-d355-4da5-a9f0-5f14463cc273","resolution":{"observed_at":"2026-07-03T20:38:54.934420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T18:20:37.325806+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T06:11:38.403281Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02914","last_updated":"2026-07-03T03:19:39Z","snapshot_observed_at":"2026-08-06T07:16:16.960857Z","submitted_at":"2026-07-03T03:19:39Z","title":"Oyster-II: Reinforcement Learning for Constructive Safety Alignment in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:11:38.403281Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.02914"},"observation_digest":"sha256:ba3d74041027e849cb9767043c682187ce8e05413191257106b28b3983f2f44f","observation_id":"b9561dc8-97ce-42f3-af4f-499781103678","resolution":{"observed_at":"2026-07-12T06:11:38.403281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-12T14:28:50.627444Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05407","last_updated":"2026-06-09T03:22:53Z","snapshot_observed_at":"2026-08-07T08:54:21.406314Z","submitted_at":"2026-06-09T03:22:53Z","title":"Position: Preventing AI-Generated CSAM Necessitates New Approaches to AI Safety","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-12T14:28:50.627444Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.05407"},"observation_digest":"sha256:de28252a468186278f73159a0f7a25db1102f92230df0baa9a5ca4702561e328","observation_id":"5be75692-127e-4334-b317-c72f709d75c2","resolution":{"observed_at":"2026-07-12T14:28:50.627444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-14T14:12:44.286699Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10114","last_updated":"2026-07-11T04:30:43Z","snapshot_observed_at":"2026-08-07T22:57:22.784958Z","submitted_at":"2026-07-11T04:30:43Z","title":"Cost of Reasoning in non-English Languages: A Case Study on Japanese","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-14T14:12:44.286699Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.10114"},"observation_digest":"sha256:59d9a19ecba25c6a395f542299bfb20250a95062ec9b32eae5a111d66a2004c1","observation_id":"7c8e5ee8-1db0-4ee8-b32e-b1651172bed9","resolution":{"observed_at":"2026-07-14T14:12:44.286699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-07-15T08:35:47.870083Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":1},"reference_index":230,"source":"pdf_text","source_observed_at":"2026-07-15T08:35:47.870083Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:4573c7fe85847c4f0576cb5e62ebd6c8ef6a956a386151fe1b2d72c641f137df","observation_id":"d6aed98b-cb00-497b-991a-2288d69fe821","resolution":{"observed_at":"2026-07-15T08:35:47.870083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-02T06:46:40.391719Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11999","last_updated":"2026-07-15T02:43:14Z","snapshot_observed_at":"2026-08-02T23:32:24.396963Z","submitted_at":"2026-07-13T17:48:25Z","title":"Underwriting the Agent Economy: The Blueprint for an AI Insurance Stack","version":2},"reference_index":231,"source":"pdf_text","source_observed_at":"2026-08-02T06:46:40.391719Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.11999"},"observation_digest":"sha256:1afe1eb0f679c0cc74db4e27f1aa951f6a93e0495b73846a7af5e77dde3ab47c","observation_id":"a01fcd39-8be5-4f88-84ba-1f363099a19e","resolution":{"observed_at":"2026-08-02T06:46:40.391719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T23:15:23.274320Z","title":"Guan, Manas Joglekar, Eric Wallace, Saachi Jain, Boaz Barak, Alec Helyar, Rachel Dias, Andrea Vallone, Hongyu Ren, Jason Wei, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15495","last_updated":"2026-07-16T22:54:30Z","snapshot_observed_at":"2026-08-07T08:22:43.917790Z","submitted_at":"2026-07-16T22:54:30Z","title":"Verbalizable Representations Form a Global Workspace in Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T23:15:23.274320Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.15495"},"observation_digest":"sha256:956f381063dbc511fffe00eaac3bb63dbfa0d6e528160947118a522cd577b769","observation_id":"d406d612-cdeb-4712-a465-bb94445022c3","resolution":{"observed_at":"2026-08-01T23:15:23.274320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T16:35:30.952522Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17946","last_updated":"2026-07-20T13:46:47Z","snapshot_observed_at":"2026-08-06T07:04:27.489300Z","submitted_at":"2026-07-20T13:46:47Z","title":"A Geometric Perspective on Stabilizing Value Conflict Resolution","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:35:30.952522Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.17946"},"observation_digest":"sha256:4e987d11efc1cc8f4da1fd3c3b18a65d6e7663c57f45b6dc4f1cf4ad6f4fbc85","observation_id":"4492457e-d1d8-4fe6-ac1c-0f87fa2c6a30","resolution":{"observed_at":"2026-08-01T16:35:30.952522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T08:38:55.560417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21063","last_updated":"2026-07-23T08:56:11Z","snapshot_observed_at":"2026-08-07T01:50:19.863208Z","submitted_at":"2026-07-23T08:56:11Z","title":"QuantiBias: Benchmarking Quantization-Induced Bias in LLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T08:38:55.560417Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.21063"},"observation_digest":"sha256:aafb367b218cc59db6eec1fb72825fa566b570daa9eb27a6db9b055663e34442","observation_id":"79cea9df-6c32-4571-bcc4-7adcd1b3fb91","resolution":{"observed_at":"2026-08-01T08:38:55.560417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T00:38:41.667721Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26173","last_updated":"2026-07-28T18:29:45Z","snapshot_observed_at":"2026-08-08T16:10:22.110949Z","submitted_at":"2026-07-28T18:29:45Z","title":"Shared SFT Lessons Across Alignment, Model Organisms, and Toy Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T00:38:41.667721Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.26173"},"observation_digest":"sha256:480f10b405ed5f3a38f05ef1038f59db33ae2702076075d88eed1df47aec82e7","observation_id":"d4c5bf99-e663-4e71-8425-5902ed995ed8","resolution":{"observed_at":"2026-08-01T00:38:41.667721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-01T11:35:00.225163Z","title":"arXiv preprint arXiv:2412.16339 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26654","last_updated":"2026-07-30T16:11:54Z","snapshot_observed_at":"2026-08-08T23:05:14.753460Z","submitted_at":"2026-07-29T09:15:40Z","title":"Constitutional Midtraining: Content Presence Drives Alignment Gains","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T11:35:00.225163Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.26654"},"observation_digest":"sha256:6bedbbcc3e2440e7cdfa42c1a186ba1016b790a85804eccf134daac82e79c30f","observation_id":"78a191ed-6886-4149-8e7f-11aeed5beb12","resolution":{"observed_at":"2026-08-01T11:35:00.225163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T00:55:26.100966Z","title":"2024 , author=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:26.100966Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:b0825af6bb8ca38fc5019a70235bb16c36fa4026a68b4123a673889db55b4b00","observation_id":"db5790cb-4fa6-40dc-a93d-2b4355464f2f","resolution":{"observed_at":"2026-08-03T00:55:26.100966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-03T14:38:56.180832Z","title":"Deliberative alignment: Reasoning enables safer language models.arXiv preprint arXiv:2412.16339, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29052","last_updated":"2026-07-31T06:10:24Z","snapshot_observed_at":"2026-08-07T23:16:28.831432Z","submitted_at":"2026-07-31T06:10:24Z","title":"Outcome-Guided Distillation: A Teacher-Student Framework to Advance VLM Reasoning in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:38:56.180832Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2607.29052"},"observation_digest":"sha256:168339d8e7d77614e33ee2cf04aba084e0d3c3d0c6a748edb2eb2a0d2b1e9efd","observation_id":"77fe7ada-8310-426f-8ddf-ff0fc104378d","resolution":{"observed_at":"2026-08-03T14:38:56.180832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-08T01:04:40.841373Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03070","last_updated":"2026-08-05T18:50:24Z","snapshot_observed_at":"2026-08-09T13:09:41.542771Z","submitted_at":"2026-08-04T03:32:19Z","title":"AI Security Leaderboard: Methodology, Results and Minimal Standard","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T01:04:40.841373Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2608.03070"},"observation_digest":"sha256:4297a7fb4c6d3e28669717c333d43f5415a5e00322b69e42934e9b38f27cfc70","observation_id":"50f5ab3b-2cb7-4d9f-b6dd-cb0e3db16493","resolution":{"observed_at":"2026-08-08T01:04:40.841373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16339/citation-record","integrity":"/paper/2412.16339/integrity","json":"/paper/2412.16339/citation-record.json","paper":"/paper/2412.16339"},"outbound":[],"paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:13:03.652587Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 86 inbound Pith citation observations for arXiv:2412.16339."}