{"as_of":"2026-08-08T21:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ec6ce6be83472edcdc0b5e83ee7f2f49c5e2540699798b32a7aa9367fc34755","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:25:30.688823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:59:33.707048Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:2ed732dc1a3b91d81ac8bfdfafd741a803205e592be570b7bf4b5d5ef142c8e5","observation_id":"cf1f22e1-580c-4e5a-ba21-6dc19222373c","resolution":{"observed_at":"2026-05-15T02:20:44.438218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-08T12:25:30.688823Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07557","last_updated":"2025-02-11T13:50:50Z","snapshot_observed_at":"2026-08-08T12:17:35.324211Z","submitted_at":"2025-02-11T13:50:50Z","title":"JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:30.688823Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2502.07557"},"observation_digest":"sha256:70d9a90c6f7bc93c7ad8330abf7ca47a570d8b2fac9733cb872396857241cc52","observation_id":"f0ea2f5a-db58-414d-b1fd-6642c58c4119","resolution":{"observed_at":"2026-08-08T12:25:30.688823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-07T23:08:02.387653Z","title":"Y., and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09674","last_updated":"2025-05-27T08:40:42Z","snapshot_observed_at":"2026-08-07T22:55:15.992320Z","submitted_at":"2025-02-13T06:39:22Z","title":"The Hidden Dimensions of LLM Alignment: A Multi-Dimensional Analysis of Orthogonal Safety Directions","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T23:08:02.387653Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2502.09674"},"observation_digest":"sha256:7fd3ac08f195646c2b9fe6910d961172d1ccd115b73019797cd0dfcd82e20e67","observation_id":"434dbf62-dba0-407d-a3db-c61502453e29","resolution":{"observed_at":"2026-08-07T23:08:02.387653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-07T15:42:33.939169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17078","last_updated":"2025-05-20T08:29:11Z","snapshot_observed_at":"2026-08-08T01:24:08.249837Z","submitted_at":"2025-05-20T08:29:11Z","title":"GloSS over Toxicity: Understanding and Mitigating Toxicity in LLMs via Global Toxic Subspace","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:33.939169Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2505.17078"},"observation_digest":"sha256:ad02d690a6c1e95fae1d88a82912c389eea2532f6b0103439db3638dda8ee9ee","observation_id":"81774b8d-8151-4458-9f5b-abf3727b8984","resolution":{"observed_at":"2026-08-07T15:42:33.939169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-06T19:57:44.540195Z","title":"Y., and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04250","last_updated":"2025-07-06T05:47:04Z","snapshot_observed_at":"2026-08-07T18:43:56.210003Z","submitted_at":"2025-07-06T05:47:04Z","title":"Just Enough Shifts: Mitigating Over-Refusal in Aligned Language Models with Targeted Representation Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:57:44.540195Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2507.04250"},"observation_digest":"sha256:630b5d07eab520fcff720a29220c5b04a1a5282e270acbb3707f8f4d42afe32d","observation_id":"6063ade9-b576-467b-acb4-3cb2196d7f7e","resolution":{"observed_at":"2026-08-06T19:57:44.540195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-06T05:43:39.465663Z","title":"Y.; and Poovendran, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01306","last_updated":"2025-08-02T10:36:01Z","snapshot_observed_at":"2026-08-07T23:43:09.319089Z","submitted_at":"2025-08-02T10:36:01Z","title":"PUZZLED: Jailbreaking LLMs through Word-Based Puzzles","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:43:39.465663Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2508.01306"},"observation_digest":"sha256:61a6979ecbe7816946c9113e8ff68cb9dd01c866bfb1f2a779770380bead9ad3","observation_id":"639dec63-bc50-4249-b2cf-74d0d7b6919f","resolution":{"observed_at":"2026-08-06T05:43:39.465663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-06T04:47:25.646303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03054","last_updated":"2025-08-05T03:58:15Z","snapshot_observed_at":"2026-08-08T05:44:09.712429Z","submitted_at":"2025-08-05T03:58:15Z","title":"Beyond Surface-Level Detection: Towards Cognitive-Driven Defense Against Jailbreak Attacks via Meta-Operations Reasoning","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-08-06T04:47:25.646303Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2508.03054"},"observation_digest":"sha256:4a064ce5d151610c653925714aac1f5f74c35808179fc60a62266a5ebd865b98","observation_id":"210db1dc-0fcf-4a74-b547-da981641cae6","resolution":{"observed_at":"2026-08-06T04:47:25.646303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2508.04204","last_updated":"2026-05-06T06:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T08:35:10Z","title":"ReasoningGuard: Safeguarding Large Reasoning Models with Inference-time Safety Aha Moments","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T01:02:07.088724Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2508.04204"},"observation_digest":"sha256:a25cd6c80cf5248e575bfd17485c027d9a8a33e5a3ec6063a292cd0ec7039af3","observation_id":"fa55204e-3bbd-4601-95a4-cfe519237c62","resolution":{"observed_at":"2026-05-19T01:02:54.727920Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-05T21:18:49.555908Z","title":"Lin, and Radha Poovendran","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09016","last_updated":"2025-09-10T05:08:47Z","snapshot_observed_at":"2026-08-05T21:18:35.909741Z","submitted_at":"2025-08-12T15:30:44Z","title":"A Survey on Training-free Alignment of Large Language Models","version":4},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T21:18:49.555908Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2508.09016"},"observation_digest":"sha256:209df377a64108265e0b82e7a3400752c211987ff4d487168855d6610f7d1a60","observation_id":"0b0fb6d5-9e85-465a-88d3-191905b818b9","resolution":{"observed_at":"2026-08-05T21:18:49.555908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-05T10:39:08.221533Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03871","last_updated":"2025-09-04T04:12:31Z","snapshot_observed_at":"2026-08-08T03:54:26.940042Z","submitted_at":"2025-09-04T04:12:31Z","title":"A Comprehensive Survey on Trustworthiness in Reasoning with Large Language Models","version":1},"reference_index":267,"source":"pdf_text","source_observed_at":"2026-08-05T10:39:08.221533Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2509.03871"},"observation_digest":"sha256:eee22f8e2b1fd17e8f60aff18a15fabfb5764a4a25b9ee273270b88007c12b68","observation_id":"7619697b-7203-48f8-8ed1-fb63a1dada03","resolution":{"observed_at":"2026-08-05T10:39:08.221533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-08-04T23:09:41.478401Z","title":"Safede- coding: Defending against jailbreak attacks via safety-aware decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06807","last_updated":"2025-09-08T15:39:17Z","snapshot_observed_at":"2026-08-06T11:18:26.434722Z","submitted_at":"2025-09-08T15:39:17Z","title":"MoGU V2: Toward a Higher Pareto Frontier Between Model Usability and Security","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:09:41.478401Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2509.06807"},"observation_digest":"sha256:6574c158d5c447e996e4af67725f1ff574d463bb08dfb1f95b9180a2832bb053","observation_id":"0986a88f-38f8-4ea1-9def-a33b45ba276e","resolution":{"observed_at":"2026-08-04T23:09:41.478401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2604.07727","last_updated":"2026-04-09T02:22:44Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:22:44Z","title":"TrajGuard: Streaming Hidden-state Trajectory Detection for Decoding-time Jailbreak Defense","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T18:26:19.922383Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2604.07727"},"observation_digest":"sha256:788f16b1ccfcc24b514d5e58ee8a81d8f33af355660313404e35a322887af111","observation_id":"a5d493be-74b1-4ce1-bc43-1ed95bf91700","resolution":{"observed_at":"2026-05-11T00:35:50.904105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2604.10326","last_updated":"2026-04-11T19:19:05Z","snapshot_observed_at":"2026-07-06T22:59:01.129724Z","submitted_at":"2026-04-11T19:19:05Z","title":"Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T15:19:46.920899Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2604.10326"},"observation_digest":"sha256:29a6932c8230a644f5910abd56ba9e1c455ee4e0d7a6795a40d6a09ab50ffec7","observation_id":"c920d2a6-be03-4670-8fdc-06c68e8b3dfd","resolution":{"observed_at":"2026-05-11T10:46:04.241295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2604.24082","last_updated":"2026-04-27T06:12:43Z","snapshot_observed_at":"2026-07-06T23:10:12.016186Z","submitted_at":"2026-04-27T06:12:43Z","title":"Jailbreaking Frontier Foundation Models Through Intention Deception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T03:17:51.039062Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2604.24082"},"observation_digest":"sha256:b413d0546e3ec1405977c12b580ebcbda0b194793f4633290bb5bbb354de68fe","observation_id":"4a9abf7e-acab-4d20-9778-4bb2a44b8bd7","resolution":{"observed_at":"2026-05-11T22:11:14.065967Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2605.00123","last_updated":"2026-08-02T03:33:29Z","snapshot_observed_at":"2026-08-06T23:24:33.180628Z","submitted_at":"2026-04-30T18:22:19Z","title":"Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T20:39:39.225898Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2605.00123"},"observation_digest":"sha256:e8799dbce5498b80866ad85251d1a1644a9c972a159b1f1980f391662c2bcb17","observation_id":"50551200-c250-4ecb-ab89-7297a7cf4dcc","resolution":{"observed_at":"2026-05-11T15:01:09.635553Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2605.11716","last_updated":"2026-05-12T08:05:10Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:05:10Z","title":"SafeSteer: A Decoding-level Defense Mechanism for Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T06:56:10.053418Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2605.11716"},"observation_digest":"sha256:669c05bdae583c54da78d166dc08710ca9b21efedbba47e9181e871ffc4720d1","observation_id":"3efa7aa7-9924-440f-9f25-3af5375d4347","resolution":{"observed_at":"2026-05-13T06:57:27.549492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2606.03486","last_updated":"2026-06-02T11:01:50Z","snapshot_observed_at":"2026-08-02T23:13:19.280728Z","submitted_at":"2026-06-02T11:01:50Z","title":"NeuroArmor: Safe-Variant-Guided Representation Consistency for Selective Re-Anchoring in Jailbreak Defense","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T09:42:58.615078Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2606.03486"},"observation_digest":"sha256:9eb750f0f048a9692a03f2478cca2a8eca3c27ae5c4991f0ae532f6785200946","observation_id":"bd96da19-f6e6-4fbf-8aad-ec088501005c","resolution":{"observed_at":"2026-07-02T03:46:32.739091Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2606.05609","last_updated":"2026-06-04T02:31:29Z","snapshot_observed_at":"2026-08-05T14:48:48.513078Z","submitted_at":"2026-06-04T02:31:29Z","title":"SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T01:16:07.252429Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2606.05609"},"observation_digest":"sha256:356d311093d7a417373bfb131c02b244ba8fa9fc80664caba90b7f1ace8d3faf","observation_id":"e7372632-2dd5-4540-8213-2e1e0ac76ba5","resolution":{"observed_at":"2026-07-02T13:26:59.257417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2606.19755","last_updated":"2026-06-18T03:35:32Z","snapshot_observed_at":"2026-07-06T23:55:01.487552Z","submitted_at":"2026-06-18T03:35:32Z","title":"SafeSpec: Fast and Safe LLM via Dynamic Reflective Sampling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T17:23:06.382761Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2606.19755"},"observation_digest":"sha256:6eaac77f260812e6254e36f7b7d699bc49a07fa72f13ec04ffbf63566edc31cf","observation_id":"a385f6c9-16d1-429e-ae3e-d9e873aa672b","resolution":{"observed_at":"2026-07-04T03:59:33.709134Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding","version":4},"cited_work":{"arxiv_id":"2402.08983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08983","snapshot_observed_at":"2026-07-04T03:59:33.707048Z","title":"Safedecoding: Defending against jailbreak attacks via safety-aware decoding","venue":null,"work_id":"4ef53380-a5e1-45ac-8f1e-ff1525924f48","year":2025},"citing_paper":{"arxiv_id":"2606.28153","last_updated":"2026-06-29T15:00:34Z","snapshot_observed_at":"2026-07-07T00:02:18.989389Z","submitted_at":"2026-06-26T14:51:16Z","title":"Robust Harmful Features Under Jailbreak Attacks: Mechanistic Evidence from Attention Head Specialization in Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T03:35:34.594617Z"},"links":{"cited_paper":"/paper/2402.08983","citing_paper":"/paper/2606.28153"},"observation_digest":"sha256:9b468e4f01d8c5243d7e8d42872648bb5a49a5a54f2a11d0f9e13bbd114410fe","observation_id":"1596d35c-477a-491b-9715-f47be97690bd","resolution":{"observed_at":"2026-07-01T17:35:51.363638Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.08983/citation-record","integrity":"/paper/2402.08983/integrity","json":"/paper/2402.08983/citation-record.json","paper":"/paper/2402.08983"},"outbound":[],"paper":{"arxiv_id":"2402.08983","last_updated":"2024-07-25T22:59:44Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T04:06:56.137869Z","submitted_at":"2024-02-14T06:54:31Z","title":"SafeDecoding: Defending against Jailbreak Attacks via Safety-Aware Decoding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2402.08983."}