{"as_of":"2026-08-10T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:314cf7225dd23cc26ddbd4adddcde24e7884ca6490a8b53958e849b7f96857ab","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T05:22:30.509147Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.20129/citation-record","integrity":"/paper/2510.20129/integrity","json":"/paper/2510.20129/citation-record.json","paper":"/paper/2510.20129"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:41107bc0ca9a0ddd43cb85f3e88ac8aa36cede05abc37f6edc86635944ba4d68","observation_id":"60d19697-c414-403d-8613-47f1d2a45592","resolution":{"observed_at":"2026-05-18T05:25:54.588103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-07-06T16:10:54.723336Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":"2308.14132","doi":"10.48550/arxiv.2308.14132","metadata_source":"pith","pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Detecting Language Model Attacks with Perplexity","venue":"cs.CL","work_id":"8fac4469-dd8b-4784-9ff6-13d2e74e57fb","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:b2da69871bc6a4d15008e1a79fef76d817d4f7b167bad6ab8336a68e0befd823","observation_id":"62a58878-b48d-4562-bf88-5231492a62b3","resolution":{"observed_at":"2026-05-18T05:25:54.601980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:28.65242+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-07T11:38:07.397956Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"cited_work":{"arxiv_id":"2207.14255","doi":"10.48550/arxiv.2207.14255","metadata_source":"pith","pith_arxiv_id":"2207.14255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Training of Language Models to Fill in the Middle","venue":"cs.CL","work_id":"54afe4f8-4d93-4829-99ae-2a27143a9641","year":2022},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2207.14255","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:6389965a776a98a467b7c22c1b59f4a0b3edea569d452f6e41c07685be2aa19c","observation_id":"d0fb6236-87cb-456b-af2e-ef2b9a3d95de","resolution":{"observed_at":"2026-05-18T05:25:54.581354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On the dangers of stochastic parrots: Can language models be too big? InProceedings of the 2021 ACM conference on fairness, accountability, and transparency, pp","venue":null,"work_id":"b49a66e6-cee5-4ed5-981f-74b9b323118e","year":2021},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:8a22b5ecff4d30f1288a053a8ed265fe56fa4de764ba0fe2abda2c649ca03f65","observation_id":"b0aa928f-7f2a-492b-87c5-85c78b430438","resolution":{"observed_at":"2026-05-18T05:25:54.975897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15435","last_updated":"2025-02-21T13:04:13Z","snapshot_observed_at":"2026-08-10T06:50:57.217791Z","submitted_at":"2025-02-21T13:04:13Z","title":"Single-pass Detection of Jailbreaking Input in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.15435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.15435","snapshot_observed_at":"2026-07-04T17:40:01.004170Z","title":"Single-pass detection of jailbreaking input in large language models.arXiv preprint arXiv:2502.15435","venue":null,"work_id":"6b145a9f-79b1-4997-93e0-53666b3f403a","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2502.15435","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:dee68cb619d168e1df56371b70cb898e9964127aecc8dd03ee6e711cf13638a0","observation_id":"80d9fd52-404a-445d-8d57-deb9b2c81485","resolution":{"observed_at":"2026-05-18T05:25:54.598504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on evaluation of large language models.ACM transactions on intelligent systems and technology, 15(3):1–45, 2024a","venue":null,"work_id":"b9decd04-fa8d-47b0-b41d-8426fa2ece64","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:62b76028c0557a0e64d0d391c947d1983382832abadaa3c8e116a01e5632310d","observation_id":"8ac98264-c6e6-4e9f-bfb7-50c9b0c50203","resolution":{"observed_at":"2026-05-18T05:25:54.969547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":"9ae0c422-f9e3-4f20-bcc9-3ec30d9df7dd","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:3d7c206c5a6d896d81db418a1eecd19f0ff48f71c4dfd9caf40315e2c34fd776","observation_id":"a33a43cc-c162-4524-a220-dcbf48b5f7a0","resolution":{"observed_at":"2026-05-18T05:25:54.972940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12505","last_updated":"2023-10-19T06:15:05Z","snapshot_observed_at":"2026-08-09T11:31:22.019671Z","submitted_at":"2023-10-19T06:15:05Z","title":"Attack Prompt Generation for Red Teaming and Defending Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.12505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.12505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attack prompt generation for red teaming and defending large language models.arXiv preprint arXiv:2310.12505","venue":null,"work_id":"9c608c1b-2d5b-4cb3-af08-642484ba3083","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.12505","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:3892c49bc751dee987e649d3636ee60cc58730939b85482a66c9c2bafe704e64","observation_id":"bdcdeac0-827d-4bbc-9058-f8fe59b29b4a","resolution":{"observed_at":"2026-05-18T05:25:54.594563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17034","last_updated":"2025-05-21T16:47:23Z","snapshot_observed_at":"2026-07-06T20:11:46.794148Z","submitted_at":"2024-12-22T14:18:39Z","title":"Shaping the Safety Boundaries: Understanding and Defending Against Jailbreaks in Large Language Models","version":2},"cited_work":{"arxiv_id":"2412.17034","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17034","snapshot_observed_at":"2026-07-02T17:37:14.918785Z","title":"Shaping the safety boundaries: Understanding and defending against jailbreaks in large language models.arXiv preprint arXiv:2412.17034","venue":null,"work_id":"af1b473d-82a5-4baa-b8e6-81a99f1b3e39","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2412.17034","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:c3fbeddd4ced56e3299496a6d7d4f75153dbadb611a6884d7eb985371ab7469a","observation_id":"46a53fd7-b283-434a-8f45-3a266a9a2acb","resolution":{"observed_at":"2026-05-18T05:25:54.605699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00934","last_updated":"2024-04-03T17:04:06Z","snapshot_observed_at":"2026-07-06T17:53:51.988186Z","submitted_at":"2024-04-01T05:39:36Z","title":"ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback","version":2},"cited_work":{"arxiv_id":"2404.00934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.00934","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatglm- rlhf: Practices of aligning large language models with human feedback","venue":null,"work_id":"c9ced531-0d1d-4eb8-88f5-be15e8d55087","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2404.00934","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:be76ada61cc000dc6ce545f3251028c25a69dcec00a03fd80168cd000486ab29","observation_id":"5653751b-b50d-4246-aec2-17d7a6739f09","resolution":{"observed_at":"2026-05-18T05:25:54.591261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00614","last_updated":"2023-09-04T17:47:36Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:44Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2309.00614","doi":"10.48550/arxiv.2309.00614","metadata_source":"pith","pith_arxiv_id":"2309.00614","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Baseline Defenses for Adversarial Attacks Against Aligned Language Models","venue":"cs.LG","work_id":"db5870ca-177b-4d1d-a08d-ee5ceab17fe3","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2309.00614","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:0e01d7fc645f95939362f78603c96548cf378a1c76ecc3542fe8a4266a30a26b","observation_id":"3334fb1b-1f0b-4af7-83ed-f8955a7ebb35","resolution":{"observed_at":"2026-05-18T05:25:54.584578Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:31.483658+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:ae9d8382d74aa1918fd3856504faf40c89a5167ae77f9830fe1d9570200b8f39","observation_id":"c39e4aac-3abc-478b-9ea1-51ed769a62ea","resolution":{"observed_at":"2026-05-18T05:25:54.608709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-04T19:12:56.970085Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":"2311.03191","doi":"10.48550/arxiv.2311.03191","metadata_source":"pith","pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","venue":"cs.LG","work_id":"5ab14a22-d25d-4d5f-8b1e-f2ff79daf69d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:3c02f58760f666f4ae3e6c64b04b7388dfd5ba8b333f2e069d4dd32bcda7d7ee","observation_id":"692ae75b-197e-4f6e-8e29-e1d2b887ca24","resolution":{"observed_at":"2026-05-19T10:37:07.279605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13068","last_updated":"2026-04-18T08:25:50Z","snapshot_observed_at":"2026-08-04T20:18:53.393132Z","submitted_at":"2024-05-20T17:17:55Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","version":4},"cited_work":{"arxiv_id":"2405.13068","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.13068","snapshot_observed_at":"2026-07-03T11:58:06.187543Z","title":"Uncovering Logit Suppression Vulnerabilities in LLM Safety Alignment","venue":"cs.CR","work_id":"6a91df1e-a757-48f8-8a05-1583522ece9d","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2405.13068","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:9d653c56d1262c02f36f4b449e82cc82d3e06a7dd873b65987aef171e53ee337","observation_id":"3630742f-6a01-4f88-983f-14b53afa37ef","resolution":{"observed_at":"2026-05-18T05:25:54.619328Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01552","last_updated":"2023-12-04T00:46:11Z","snapshot_observed_at":"2026-08-07T00:42:49.627314Z","submitted_at":"2023-12-04T00:46:11Z","title":"The Unlocking Spell on Base LLMs: Rethinking Alignment via In-Context Learning","version":1},"cited_work":{"arxiv_id":"2312.01552","doi":"10.48550/arxiv.2312.01552","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01552","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2312.01552 , year=","venue":"arXiv (Cornell University)","work_id":"f9e86809-ec80-4d62-85ec-21e6c6680c43","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2312.01552","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:be9dcbd60660906c72e167f197a2e97b7b3cf642057d3875d0583d6a2384b2d1","observation_id":"a4f16710-d197-41d0-9f06-c86237e9b564","resolution":{"observed_at":"2026-05-18T05:25:54.623202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":"2310.04451","doi":"10.48550/arxiv.2310.04451","metadata_source":"pith","pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","venue":"cs.CL","work_id":"3b676de6-edef-4976-a8b5-082d4ff50867","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:433de8f5177963a41e47a63553e923046b8d707e2ba88a561e3fc9e1f7723c4f","observation_id":"7604e27f-5245-40be-ac1c-8aba2983e0c0","resolution":{"observed_at":"2026-05-18T05:25:54.615726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T04:52:41.614605+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-07-06T19:27:16.301809Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":"2410.02832","doi":"10.48550/arxiv.2410.02832","metadata_source":"pith","pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FlipAttack: Jailbreak LLMs via Flipping","venue":"cs.CR","work_id":"247bb9a4-1fea-4de4-9873-697a30aae57b","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:3aadbef3f05e5578e1b11040820f99989ba389a6e1c9b6f7a21cce4774d79c0c","observation_id":"eddb566c-e329-4d43-988d-fec1b861e745","resolution":{"observed_at":"2026-05-20T00:00:16.351675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:0d4f039d13fcf254373916e32413ff04966198c218fdd53c1409e03feac4421b","observation_id":"f005551b-3535-4fbc-8b50-44a2164ce102","resolution":{"observed_at":"2026-05-18T05:25:54.612403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":"2310.06387","doi":"10.48550/arxiv.2310.06387","metadata_source":"pith","pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations","venue":"cs.LG","work_id":"4fe10dc2-a8a4-46ec-bb39-b0edae135f1d","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:2877ab3cc0d9769b6632501cd091c3ce1c1c56d65459e2057f06104d50cae76b","observation_id":"8b9af65f-eef9-4e39-b148-2c7c4b2f4287","resolution":{"observed_at":"2026-05-18T05:25:54.630924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:10.432951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19041","last_updated":"2025-05-28T06:36:50Z","snapshot_observed_at":"2026-08-07T17:46:57.247575Z","submitted_at":"2025-02-26T10:53:58Z","title":"Beyond Surface-Level Patterns: An Essence-Driven Defense Framework Against Jailbreak Attacks in LLMs","version":2},"cited_work":{"arxiv_id":"2502.19041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.19041","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond surface-level pat- terns: An essence-driven defense framework against jailbreak attacks in llms.arXiv preprint arXiv:2502.19041","venue":null,"work_id":"cc5a3173-97a8-4c76-a683-cd1b42b94116","year":null},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2502.19041","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:9b770bd60ae482052058789f5b97901d5b9d93c1e57c0483451b5ff16838fed2","observation_id":"f4a23f62-8ce5-41e7-8783-73cd59afbd12","resolution":{"observed_at":"2026-05-18T05:25:54.651445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02756","last_updated":"2024-06-04T20:21:45Z","snapshot_observed_at":"2026-07-06T18:25:31.706930Z","submitted_at":"2024-06-04T20:21:45Z","title":"Aligning Large Language Models via Fine-grained Supervision","version":1},"cited_work":{"arxiv_id":"2406.02756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02756","snapshot_observed_at":"2026-07-02T07:26:46.053194Z","title":"Aligning large language models via fine-grained supervision.arXiv preprint arXiv:2406.02756, 2024a","venue":null,"work_id":"343ea319-092b-42f2-ba3c-7a9854d00bd2","year":2024},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2406.02756","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:27907f29f4b37596a975da2c8f373059fc83289942f1d95a938c383efb828fa4","observation_id":"fcdc1f0f-0310-4bd3-85ac-c878661eb97d","resolution":{"observed_at":"2026-05-18T05:25:54.634495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01565","last_updated":"2025-05-21T16:29:45Z","snapshot_observed_at":"2026-07-30T17:30:05.335961Z","submitted_at":"2024-11-03T13:36:34Z","title":"SQL Injection Jailbreak: A Structural Disaster of Large Language Models","version":6},"cited_work":{"arxiv_id":"2411.01565","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.01565","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sql injection jailbreak: A structural disaster of large language models.arXiv preprint arXiv:2411.01565","venue":null,"work_id":"91af8c96-a6f8-4765-982f-e4da6ca91575","year":null},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2411.01565","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:34a4767ef4c37b8b926e52666d9b93ebecc91908518b24f6a398328c341b6065","observation_id":"e1dc0f50-33f0-44c8-a642-1a38297e42ae","resolution":{"observed_at":"2026-05-18T05:25:54.641114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":"2303.18223","doi":"10.18653/v1/d16-1080","metadata_source":"pith","pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Large Language Models","venue":"cs.CL","work_id":"de1b42b5-4a0a-4b1f-8c78-1f7fe21be6c9","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:144521b7e3f5d2ff64c62e0b09697aeba39c58f1406814824518eec5f7e6d492","observation_id":"47c0bf16-1594-4405-a165-94c5d2ae83f1","resolution":{"observed_at":"2026-05-18T05:25:54.637716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:8dc2a1e066c2ec05e2bd5755a172795f9cf879fd45672789ea1aa163bf7bef36","observation_id":"bde3143e-20e0-43e6-a32c-d846de78f1bd","resolution":{"observed_at":"2026-05-18T05:25:54.644521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"comment- ing out","venue":null,"work_id":"87ae847b-d842-4c6b-8e92-a61ea4e1604f","year":2023},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:7bc1f7943697a89e60cfa85423f773de9df437f9e0136c3cfaa63a1ad543665e","observation_id":"26b76b3f-b214-4dfe-876f-9241edfc35ca","resolution":{"observed_at":"2026-05-18T05:25:54.981075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can I”, significantly outperform prefixes that carry a strong personal or instructional intent, like “Can you teach me to do this to others","venue":null,"work_id":"2d66072b-a4f1-4f9f-aa0f-141c96ed598a","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:d7d04f571bf87a0117fddde6eb27a5e3e435d77f6c8ecf31a46e1ee70810e42a","observation_id":"0ff281eb-4bc6-480f-8262-4ba0b439132c","resolution":{"observed_at":"2026-05-18T05:25:54.983873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"role-playing","venue":null,"work_id":"75511153-187b-41fa-877e-c37f55b4d408","year":2025},"citing_paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:30.509147Z"},"links":{"citing_paper":"/paper/2510.20129"},"observation_digest":"sha256:ce8e58d3509ae424fdb3b426f3e973ec1d8b2e812d8ca36f2c8c580404816155","observation_id":"e22bf799-5ac6-4635-9ffa-62842cc5e0f9","resolution":{"observed_at":"2026-05-18T05:25:54.978587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.20129","last_updated":"2026-05-11T03:07:14Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-06T10:08:56.596804Z","submitted_at":"2025-10-23T02:07:54Z","title":"SAID: Safety-Aware Intent Defense via Prefix Probing for Large Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2510.20129."}