{"as_of":"2026-08-23T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:adc666a850d92a7f9f91e23321e948facee532d679d238d17b53739b1e394a07","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T04:22:00.629797Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T08:17:10.481202Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2602.11157","last_updated":"2025-12-08T06:48:17Z","snapshot_observed_at":"2026-08-11T06:21:28.149022Z","submitted_at":"2025-12-08T06:48:17Z","title":"Response-Based Knowledge Distillation for Multilingual Jailbreak Prevention Unwittingly Compromises Safety","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T01:27:16.967080Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2602.11157"},"observation_digest":"sha256:f467a3ed6acbc5ca52565947d36a134553177973c00efefdd7e66cb7fa53211e","observation_id":"aee82b5c-2cb2-4aca-8879-ad5fd2588850","resolution":{"observed_at":"2026-05-17T01:28:48.757064Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2605.12813","last_updated":"2026-05-31T17:51:51Z","snapshot_observed_at":"2026-08-20T19:02:09.543322Z","submitted_at":"2026-05-12T23:13:50Z","title":"REALISTA: Realistic Latent Adversarial Attacks that Elicit LLM Hallucinations","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:10.814899Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2605.12813"},"observation_digest":"sha256:25fae968cec38f496cbea8a9fc9db33bfbfa38cfe8ffb96fda2e172beb8c8d7f","observation_id":"aea6f80c-12a2-4d8b-a998-5451fc2c2e92","resolution":{"observed_at":"2026-05-14T20:17:56.857636Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"cited_work":{"arxiv_id":"2502.05223","doi":"10.48550/arxiv.2502.05223","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.05223","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kda: A knowledge-distilled attacker for generating diverse prompts to jailbreak llms","venue":"ArXiv.org","work_id":"0d29aadb-c6de-4d0b-b7f0-a0969a7354f0","year":2025},"citing_paper":{"arxiv_id":"2606.07539","last_updated":"2026-04-29T17:39:36Z","snapshot_observed_at":"2026-08-02T12:30:34.186010Z","submitted_at":"2026-04-29T17:39:36Z","title":"Prompt Governance? On Governing Technologies Governed by Natural Language","version":1},"reference_index":200,"source":"pdf_text","source_observed_at":"2026-07-01T08:17:10.481202Z"},"links":{"cited_paper":"/paper/2502.05223","citing_paper":"/paper/2606.07539"},"observation_digest":"sha256:f4afec6083be4519810d51ec3fc369ffa45d7ee931a0ba665f8e36be32062bc7","observation_id":"069a6103-2a68-4c7d-8e54-236b5a44bc91","resolution":{"observed_at":"2026-07-01T08:25:32.845932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.05223/citation-record","integrity":"/paper/2502.05223/integrity","json":"/paper/2502.05223/citation-record.json","paper":"/paper/2502.05223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.402335Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.402335Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8721dd107b2fd098f53c6c272aa4598279a4973ae57fa0ffe7a0cea0c5aba770","observation_id":"459f049e-e32d-4f03-bf86-078caf999575","resolution":{"observed_at":"2026-08-09T04:22:00.402335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-09T04:22:00.409603Z","title":"and Kamfonas, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.409603Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:9245269562cbcd64744d6035c1f7889b73671e1d8a087474ee9bac06029add8d","observation_id":"6e7713c9-9c8c-4d40-a39c-56ef3f94ee16","resolution":{"observed_at":"2026-08-09T04:22:00.409603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02151","last_updated":"2025-04-17T18:55:45Z","snapshot_observed_at":"2026-08-16T14:04:12.947538Z","submitted_at":"2024-04-02T17:58:27Z","title":"Jailbreaking Leading Safety-Aligned LLMs with Simple Adaptive Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02151","snapshot_observed_at":"2026-08-09T04:22:00.415583Z","title":"Jailbreaking Leading Safety - Aligned LLMs with Simple Adaptive Attacks , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.415583Z"},"links":{"cited_paper":"/paper/2404.02151","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:2b25ee8f4a5439cf00d12133640385697a1c87b887dfb76f5b5682f3a26256f3","observation_id":"191688ba-f10c-44cf-82ca-eb966100d94a","resolution":{"observed_at":"2026-08-09T04:22:00.415583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09091","last_updated":"2024-02-16T10:24:04Z","snapshot_observed_at":"2026-08-19T17:48:15.727395Z","submitted_at":"2024-02-14T11:11:51Z","title":"Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09091","snapshot_observed_at":"2026-08-09T04:22:00.421184Z","title":"Play Guessing Game with LLM : Indirect Jailbreak Attack with Implicit Clues , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.421184Z"},"links":{"cited_paper":"/paper/2402.09091","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:af60be4031116b14ccc60d782505e12d7e5c66d5534863538840071617cea31a","observation_id":"5088ebba-7f09-473d-87a0-af1d184e04fd","resolution":{"observed_at":"2026-08-09T04:22:00.421184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-09T04:22:00.426038Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.426038Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:4430a99483dd7d01f4fb27faad294c05f9e592c8911f98049d09e9b62a3c0aa7","observation_id":"80cdee47-7175-435b-8cd9-458f16846005","resolution":{"observed_at":"2026-08-09T04:22:00.426038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08268","last_updated":"2024-04-07T03:04:10Z","snapshot_observed_at":"2026-08-16T14:43:23.466774Z","submitted_at":"2023-11-14T16:02:16Z","title":"A Wolf in Sheep's Clothing: Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08268","snapshot_observed_at":"2026-08-09T04:22:00.430779Z","title":"A Wolf in Sheep 's Clothing : Generalized Nested Jailbreak Prompts can Fool Large Language Models Easily , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.430779Z"},"links":{"cited_paper":"/paper/2311.08268","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:6732ed91629b29e48b1cec5d5964cdafecd03dc03cfae7db50e701df7e1b4efe","observation_id":"64be1b15-dd59-433c-845e-99f6590d888e","resolution":{"observed_at":"2026-08-09T04:22:00.430779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T04:22:00.435398Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.435398Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:b7bb4128fc35751b0343747ac33b3a95321b117795dbf9d92f9dd4e3d735f3bd","observation_id":"61743f0c-2d37-4243-8c85-ec7bf8150e34","resolution":{"observed_at":"2026-08-09T04:22:00.435398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-09T04:22:00.440887Z","title":"BERTopic : Neural topic modeling with a class-based TF - IDF procedure, March 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.440887Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:efa22dc7cea072c0debfe9dbe233b4acc4ff981c1efd3772222d851de4c9fe9c","observation_id":"278ecdb3-bffe-4857-8bc4-04b004ce9f9c","resolution":{"observed_at":"2026-08-09T04:22:00.440887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-20T07:42:33.888647Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-09T04:22:00.445532Z","title":"COLD - Attack : Jailbreaking LLMs with Stealthiness and Controllability , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.445532Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:71539aa68ec8e1e0f834b80336b583014528e4a232283fde534796c59941c9e3","observation_id":"e68ec673-131f-4676-807a-597eee54ec68","resolution":{"observed_at":"2026-08-09T04:22:00.445532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T04:22:00.450515Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.450515Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:17b7795a4717d21af8d225810ab56ecc981d583272c506a9ffad6f64c5c957bc","observation_id":"bea59369-e07a-43b2-8280-ba77c93b01e9","resolution":{"observed_at":"2026-08-09T04:22:00.450515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11753","last_updated":"2024-06-07T17:35:17Z","snapshot_observed_at":"2026-08-17T13:43:32.178696Z","submitted_at":"2024-02-19T00:43:31Z","title":"ArtPrompt: ASCII Art-based Jailbreak Attacks against Aligned LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11753","snapshot_observed_at":"2026-08-09T04:22:00.455592Z","title":"ArtPrompt : ASCII Art -based Jailbreak Attacks against Aligned LLMs , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.455592Z"},"links":{"cited_paper":"/paper/2402.11753","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:cba12b339973bd3a081127a3fc3a13cd4cafc97d67d6fdca45e514fa79726d19","observation_id":"89ba909c-73d6-423b-9a4f-9a419dcf7c97","resolution":{"observed_at":"2026-08-09T04:22:00.455592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.460678Z","title":"ChatGPT for good? On opportunities and challenges of large language models for education","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.460678Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8d8dffbc5106ee956c32beefd27a91c16ef1ccc8062ca34dc5789ed66817d609","observation_id":"c3e539d8-921e-48b6-944e-6adec3c70b88","resolution":{"observed_at":"2026-08-09T04:22:00.460678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01446","last_updated":"2024-08-05T11:34:10Z","snapshot_observed_at":"2026-08-16T15:03:33.817088Z","submitted_at":"2023-09-04T08:54:20Z","title":"Open Sesame! Universal Black Box Jailbreaking of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01446","snapshot_observed_at":"2026-08-09T04:22:00.465363Z","title":"Open Sesame ! Universal Black Box Jailbreaking of Large Language Models , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.465363Z"},"links":{"cited_paper":"/paper/2309.01446","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:4b579fb288e34bbc32a6b45b753f52b70bac32623d8e1c9d9432f005622f9a35","observation_id":"d9172f6b-7dbe-4588-9038-23b5edfb9671","resolution":{"observed_at":"2026-08-09T04:22:00.465363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-08-22T05:25:02.232378Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-09T04:22:00.471038Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT , November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.471038Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:13d52b424f6e8170b026be18fe6463cce53002a74a7654160873c8805e15685a","observation_id":"69c29d1a-8897-4304-9e63-78f6bb46e2ba","resolution":{"observed_at":"2026-08-09T04:22:00.471038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-18T14:36:23.102820Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-09T04:22:00.476145Z","title":"Semantic Mirror Jailbreak : Genetic Algorithm Based Jailbreak Prompts Against Open -source LLMs , February 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.476145Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:34b7e7295e90f1b62e123ad121856c9bbcb7eed5c6783b2fcd9ea5781b21bbee","observation_id":"da506306-78e8-410a-8b25-a5fda1296988","resolution":{"observed_at":"2026-08-09T04:22:00.476145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16914","last_updated":"2024-11-11T23:08:20Z","snapshot_observed_at":"2026-08-16T14:15:30.913660Z","submitted_at":"2024-02-25T17:43:29Z","title":"DrAttack: Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16914","snapshot_observed_at":"2026-08-09T04:22:00.481354Z","title":"DrAttack : Prompt Decomposition and Reconstruction Makes Powerful LLM Jailbreakers , March 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.481354Z"},"links":{"cited_paper":"/paper/2402.16914","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:381472d9ce9e4681e59fe9b089188e33b484a412bf76afb552089dbb6bf6d683","observation_id":"0c83e0ae-e84b-4d66-aa77-d32bf75a8b52","resolution":{"observed_at":"2026-08-09T04:22:00.481354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03191","last_updated":"2024-11-28T13:43:50Z","snapshot_observed_at":"2026-08-18T06:50:23.685098Z","submitted_at":"2023-11-06T15:29:30Z","title":"DeepInception: Hypnotize Large Language Model to Be Jailbreaker","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03191","snapshot_observed_at":"2026-08-09T04:22:00.486463Z","title":"DeepInception : Hypnotize Large Language Model to Be Jailbreaker , May 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.486463Z"},"links":{"cited_paper":"/paper/2311.03191","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:077281f2636255976a117eed8290ad58592841b67b273cf4f9e7b7c3cf8632bb","observation_id":"ad97aa6d-bf26-4bda-b5a3-3bb411b7fb77","resolution":{"observed_at":"2026-08-09T04:22:00.486463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13401","last_updated":"2023-03-23T16:22:59Z","snapshot_observed_at":"2026-08-16T15:45:52.573810Z","submitted_at":"2023-03-23T16:22:59Z","title":"Optimization and Optimizers for Adversarial Robustness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13401","snapshot_observed_at":"2026-08-09T04:22:00.491594Z","title":"Optimization and Optimizers for Adversarial Robustness , March 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.491594Z"},"links":{"cited_paper":"/paper/2303.13401","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:a6565332548f862d26567f6ee9dd8273fbff6631cfd468bf49691deed831780d","observation_id":"8499386b-27f7-4af3-91a4-39fc6e9bf8ff","resolution":{"observed_at":"2026-08-09T04:22:00.491594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.496465Z","title":"Implications of Solution Patterns on Adversarial Robustness","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.496465Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:ffe39a5f841e2006a365349be74e23c3ac159d7e4085eab77c647b4afbda5d49","observation_id":"2e445c13-8ceb-4f88-a004-b19a9c5dedd1","resolution":{"observed_at":"2026-08-09T04:22:00.496465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07921","last_updated":"2024-11-24T18:03:43Z","snapshot_observed_at":"2026-08-17T21:47:51.183917Z","submitted_at":"2024-04-11T17:05:50Z","title":"AmpleGCG: Learning a Universal and Transferable Generative Model of Adversarial Suffixes for Jailbreaking Both Open and Closed LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07921","snapshot_observed_at":"2026-08-09T04:22:00.501027Z","title":"and Sun, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.501027Z"},"links":{"cited_paper":"/paper/2404.07921","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8849243f20199f061ee98867299069ecfbc5d9dee349f8705c84d0bf04b4fb0f","observation_id":"d30824fb-2002-4268-a59c-558d8e1eb226","resolution":{"observed_at":"2026-08-09T04:22:00.501027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18104","last_updated":"2024-06-10T11:20:43Z","snapshot_observed_at":"2026-08-16T18:08:19.232075Z","submitted_at":"2024-02-28T06:50:14Z","title":"Making Them Ask and Answer: Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18104","snapshot_observed_at":"2026-08-09T04:22:00.505854Z","title":"Making Them Ask and Answer : Jailbreaking Large Language Models in Few Queries via Disguise and Reconstruction , June 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.505854Z"},"links":{"cited_paper":"/paper/2402.18104","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:65f99c647b41c449208e6683aeb105c2ee998984ebf2306a7399145ded37fce1","observation_id":"0b1b1209-5caa-4588-a0ba-a542ca732beb","resolution":{"observed_at":"2026-08-09T04:22:00.505854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-08-20T11:24:30.504823Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-09T04:22:00.510546Z","title":"AutoDAN - Turbo : A Lifelong Agent for Strategy Self - Exploration to Jailbreak LLMs , November 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.510546Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:a471821ee56ec56b4e23f1765ed1ee30dde34f21a1caaabf6469b327a723c2c3","observation_id":"7a6bcbc2-39d1-4672-879c-75f27e4eba40","resolution":{"observed_at":"2026-08-09T04:22:00.510546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-09T04:22:00.515272Z","title":"AutoDAN : Generating Stealthy Jailbreak Prompts on Aligned Large Language Models , March 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.515272Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:cb2a04d4879359be464c524846cc1d24e2baaf97550364b74b9d41b086c6801a","observation_id":"8c63baa5-456a-4ad6-93e7-871219d91a5d","resolution":{"observed_at":"2026-08-09T04:22:00.515272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04331","last_updated":"2024-11-05T15:43:18Z","snapshot_observed_at":"2026-08-16T13:45:24.779089Z","submitted_at":"2024-06-06T17:59:10Z","title":"PaCE: Parsimonious Concept Engineering for Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.04331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04331","snapshot_observed_at":"2026-08-09T04:22:01.124740Z","title":"PaCE: Parsimonious Concept Engineering for Large Language Models","venue":"cs.CL","work_id":"e2c78cc0-1533-4dd1-a9fd-4f2401eec627","year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.520024Z"},"links":{"cited_paper":"/paper/2406.04331","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:5866526d481fd386d86f6a4eadf244ba5a2b52a3db4c422eb83cd812fec6123c","observation_id":"b43f2b73-5929-4512-a73f-49059039e97a","resolution":{"observed_at":"2026-08-09T04:22:01.131533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16717","last_updated":"2024-02-26T16:35:59Z","snapshot_observed_at":"2026-08-20T07:56:32.352535Z","submitted_at":"2024-02-26T16:35:59Z","title":"CodeChameleon: Personalized Encryption Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16717","snapshot_observed_at":"2026-08-09T04:22:00.524554Z","title":"CodeChameleon : Personalized Encryption Framework for Jailbreaking Large Language Models , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.524554Z"},"links":{"cited_paper":"/paper/2402.16717","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:61b1aacc1715d07960abf6f0e49331eb055b02a487ee3772b6795e0027a5cb29","observation_id":"0471f4b8-458c-4256-81a0-ff339a0b1d2e","resolution":{"observed_at":"2026-08-09T04:22:00.524554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-09T04:22:00.529225Z","title":"HarmBench : A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.529225Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:62b042fe7855234b46ab8a8202e5fa6ee39a6f19e489fdaa9d0846d44a7cf963","observation_id":"fac10459-bf1d-4c13-b110-7e175e3c6f89","resolution":{"observed_at":"2026-08-09T04:22:00.529225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-18T18:32:32.343266Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-09T04:22:00.533797Z","title":"Tree of Attacks : Jailbreaking Black - Box LLMs Automatically , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.533797Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:7e4b562b492d9ca3e689146a37b4d9783752a9ee37d2014c91b288c363dc6be4","observation_id":"9651c7b5-3875-4322-ac62-594d9e7c45e9","resolution":{"observed_at":"2026-08-09T04:22:00.533797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-09T04:22:00.538369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.538369Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:70b95121802f5bb6d0e4acf556043a162f5e8c85357536b39e1dd47f31951f0f","observation_id":"8fcf32ac-8614-446d-8a65-abb1eb2646e6","resolution":{"observed_at":"2026-08-09T04:22:00.538369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16873","last_updated":"2025-06-02T18:59:01Z","snapshot_observed_at":"2026-08-16T13:59:04.683003Z","submitted_at":"2024-04-21T22:18:13Z","title":"AdvPrompter: Fast Adaptive Adversarial Prompting for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16873","snapshot_observed_at":"2026-08-09T04:22:00.543215Z","title":"AdvPrompter : Fast Adaptive Adversarial Prompting for LLMs , April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.543215Z"},"links":{"cited_paper":"/paper/2404.16873","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:e84bf61596e39b1b038bdcf82169304640596b298c04e8585703b991cdeb3c1c","observation_id":"33f586e0-896b-443f-bb8a-6ccef5b4c4ea","resolution":{"observed_at":"2026-08-09T04:22:00.543215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:01.608863Z","title":"Language Models are Unsupervised Multitask Learners","venue":null,"work_id":"5d3d3449-a789-4849-af79-fbc6e278111d","year":null},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.548025Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:257329dea11784e2fbceab3f6cae44536ab7b174602144ee8e89816a856cf985","observation_id":"3271049b-af78-410a-bcea-5b81b63e4ee6","resolution":{"observed_at":"2026-08-09T04:22:01.613807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03684","last_updated":"2024-06-11T19:02:52Z","snapshot_observed_at":"2026-08-17T15:25:03.596568Z","submitted_at":"2023-10-05T17:01:53Z","title":"SmoothLLM: Defending Large Language Models Against Jailbreaking Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03684","snapshot_observed_at":"2026-08-09T04:22:00.552452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.552452Z"},"links":{"cited_paper":"/paper/2310.03684","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:a6901f58675d5812f6817dda5b3c429b31076c000eb7e2dcd476c91a8e545fa4","observation_id":"f0f9d0b6-7cde-43f0-b938-de0eabe047be","resolution":{"observed_at":"2026-08-09T04:22:00.552452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-18T03:59:39.242039Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-09T04:22:00.557214Z","title":"E., Adi, Y., Liu, J., Sauvestre, R., Remez, T., Rapin, J., Kozhevnikov, A., Evtimov, I., Bitton, J., Bhatt, M., Ferrer, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.557214Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:f0d04db7c7cc8cd65fb06ad089bb8937128d87a253689e7622b661d5feb96238","observation_id":"aa4e9fcd-d4da-4313-baff-dddabc045772","resolution":{"observed_at":"2026-08-09T04:22:00.557214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16822","last_updated":"2024-12-11T18:07:25Z","snapshot_observed_at":"2026-08-20T01:45:01.339389Z","submitted_at":"2024-02-26T18:47:27Z","title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16822","snapshot_observed_at":"2026-08-09T04:22:00.561961Z","title":"C., Lupu, A., Hambro, E., Markosyan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.561961Z"},"links":{"cited_paper":"/paper/2402.16822","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:9dfa8a7c2fb3d59a8376df3173d3c6e76626b122966737643db42e135f57ad74","observation_id":"8b8c48c7-1360-46d9-8230-a3935d895ddc","resolution":{"observed_at":"2026-08-09T04:22:00.561961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-08-16T09:32:10.049300Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-09T04:22:00.566995Z","title":"Do Anything Now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.566995Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:a4dc31d7dfcb517306e4e4f47b2a01e40c88af2ce4506eec3c1abbb34efe15ce","observation_id":"8654f3bc-4971-45fd-a9a5-6f8bbe711918","resolution":{"observed_at":"2026-08-09T04:22:00.566995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09674","last_updated":"2024-02-15T02:54:49Z","snapshot_observed_at":"2026-08-16T14:18:26.882413Z","submitted_at":"2024-02-15T02:54:49Z","title":"PAL: Proxy-Guided Black-Box Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09674","snapshot_observed_at":"2026-08-09T04:22:00.571836Z","title":"PAL : Proxy - Guided Black - Box Attack on Large Language Models , February 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.571836Z"},"links":{"cited_paper":"/paper/2402.09674","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:d0aa0b8c987707c16d149082a8466d8af558c58e178158ba871ed146ee36c846","observation_id":"7f5b80dd-b813-4747-acfb-b42906214420","resolution":{"observed_at":"2026-08-09T04:22:00.571836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:00.576698Z","title":"Fine-tuning large neural language models for biomedical natural language processing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.576698Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:4f48ea6a2daee57969d515071c29ebb1120aaccaebf0cfe2ddd3cea3d3eed9c9","observation_id":"1314c283-1c55-4387-9791-ae36b421ab10","resolution":{"observed_at":"2026-08-09T04:22:00.576698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T04:22:01.594046Z","title":"DAN is my new friend, 2022","venue":null,"work_id":"20ea7c37-43da-4609-8854-b1c18eaa7bd6","year":2022},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.581386Z"},"links":{"citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:acf82f255d65e062dcfda7ba5132b8236c65650434f3d8182c0914c901d7c23d","observation_id":"25260112-4486-4903-ae24-22b8dc441103","resolution":{"observed_at":"2026-08-09T04:22:01.598827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16006","last_updated":"2024-06-04T02:59:58Z","snapshot_observed_at":"2026-08-19T18:43:11.162602Z","submitted_at":"2024-02-25T06:46:27Z","title":"ASETF: A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16006","snapshot_observed_at":"2026-08-09T04:22:00.586129Z","title":"ASETF : A Novel Method for Jailbreak Attack on LLMs through Translate Suffix Embeddings , June 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.586129Z"},"links":{"cited_paper":"/paper/2402.16006","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:bcd660ac2b8ef983834a00562dfba15a2f3d775712a8909000e12f82f3d9c0eb","observation_id":"ca68ceff-f619-4d82-9cd6-59b7506b6773","resolution":{"observed_at":"2026-08-09T04:22:00.586129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14472","last_updated":"2024-05-28T09:11:25Z","snapshot_observed_at":"2026-08-16T14:07:38.774250Z","submitted_at":"2024-03-21T15:18:30Z","title":"Detoxifying Large Language Models via Knowledge Editing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14472","snapshot_observed_at":"2026-08-09T04:22:00.590879Z","title":"Detoxifying Large Language Models via Knowledge Editing , May 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.590879Z"},"links":{"cited_paper":"/paper/2403.14472","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:eac5f8f968498b667b1fdd05a87033ff0742f248e0f8a39f8754cfe779e58694","observation_id":"1ad1b49f-6085-4866-85ba-4e0be4fb408b","resolution":{"observed_at":"2026-08-09T04:22:00.590879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-15T10:16:52.688429Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-09T04:22:00.595645Z","title":"Jailbroken: How Does LLM Safety Training Fail ?, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.595645Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:b5fe7d336fddcd79152ddc1357fb280e0cd67352a714f63d82e72b8bf49b281b","observation_id":"13bd01fd-1ea4-4ffc-9c38-f7a871a497ed","resolution":{"observed_at":"2026-08-09T04:22:00.595645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-08-14T12:54:48.492396Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17564","snapshot_observed_at":"2026-08-09T04:22:00.600486Z","title":"BloombergGPT : A Large Language Model for Finance , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.600486Z"},"links":{"cited_paper":"/paper/2303.17564","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:4e604904696a36fda480a897713fc716b177cdc28cf43fae15ffc0d16289d799","observation_id":"03d864db-e3d3-4784-b34c-74591dfc4cfd","resolution":{"observed_at":"2026-08-09T04:22:00.600486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02446","last_updated":"2024-01-27T22:54:52Z","snapshot_observed_at":"2026-08-13T01:25:06.346704Z","submitted_at":"2023-10-03T21:30:56Z","title":"Low-Resource Languages Jailbreak GPT-4","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02446","snapshot_observed_at":"2026-08-09T04:22:00.605573Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.605573Z"},"links":{"cited_paper":"/paper/2310.02446","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:df2cb51a7e8ca6b301dd143b0ac8cf85eb4188a19cd1d97555f803a2aaa23bee","observation_id":"c6ca5c90-bcec-4041-8a42-ba1e7e58f2ab","resolution":{"observed_at":"2026-08-09T04:22:00.605573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-09T04:22:00.610406Z","title":"GPTFUZZER : Red Teaming Large Language Models with Auto - Generated Jailbreak Prompts , June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.610406Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:173c822c9c3ad505b4d87a4d0c171a0e8b4b92801596016c4aa96e2c59cf0ece","observation_id":"f7c3d5e1-2813-4608-9a57-e73e14d2ca90","resolution":{"observed_at":"2026-08-09T04:22:00.610406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-08-20T15:39:34.196904Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-09T04:22:00.615220Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them : Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs , January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.615220Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:11f5821350bbba70a262389ec3a1d7ce3bae826fd2aa137d9e2ad9c342dfbda2","observation_id":"8d14b25a-76ed-4e01-97ce-a13af257036e","resolution":{"observed_at":"2026-08-09T04:22:00.615220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-09T04:22:00.620241Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.620241Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:2ae9042b0ac47602984e443bb89426d1488470a8d4293a7a7737cd11c49cca07","observation_id":"bee0ddb6-61b0-492d-8ef8-40e55289de2d","resolution":{"observed_at":"2026-08-09T04:22:00.620241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-16T14:49:38.783564Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-09T04:22:00.624850Z","title":"AutoDAN : Interpretable Gradient - Based Adversarial Attacks on Large Language Models , December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.624850Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:0c9d42f5604af622984c24c7dd8c33a72782d8743e03c40d2979b2e64a32c39a","observation_id":"10abcab6-f732-4f54-aa9c-412cd4b2c790","resolution":{"observed_at":"2026-08-09T04:22:00.624850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-09T04:22:00.629797Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T04:22:00.629797Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2502.05223"},"observation_digest":"sha256:8fbfd927acd9a170f664ff7ed2fe1352d2d3c56ca0bdae18c779bedba9abf886","observation_id":"be48752f-c814-4ba7-ac7a-f9fa692eedd2","resolution":{"observed_at":"2026-08-09T04:22:00.629797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.05223","last_updated":"2025-02-05T21:50:34Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-18T18:29:30.078158Z","submitted_at":"2025-02-05T21:50:34Z","title":"KDA: A Knowledge-Distilled Attacker for Generating Diverse Prompts to Jailbreak LLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 3 inbound Pith citation observations for arXiv:2502.05223."}