{"as_of":"2026-08-09T20:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b47199f9ee00f6b9efc57a4a84720e63459c29a6fc076c0ad9fd00c5d5d2526","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:20:59.199192Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.18543/citation-record","integrity":"/paper/2506.18543/integrity","json":"/paper/2506.18543/citation-record.json","paper":"/paper/2506.18543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.757665Z","title":"Improving language understanding by generative pre-training2018","venue":null,"work_id":"08fc1cf1-1c04-4354-956b-bc8de6e91a1e","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.740664Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:29b05bccbc90bbdd538f5a99bdbd8139c1620a73ec6866efa936ac3aa138534e","observation_id":"aed38e89-35de-4a6d-921c-1a46b2b99efa","resolution":{"observed_at":"2026-08-06T23:21:04.904571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:20:51.894501Z","title":"GPT-4 Technical Report, 2023, [arXiv:cs.CL/2303.08774]","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.894501Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:cf28418da65447f51ef33706ccc30bab2a3ed58583e7db95c7be37412ef67be8","observation_id":"1ef3f846-4409-4170-a3c4-4c062658fd0d","resolution":{"observed_at":"2026-08-06T23:20:51.894501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-06T23:20:51.997871Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv preprint arXiv:2401.029542024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:51.997871Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ecbced91d65394b0553d0c5a727d25a6778caf7b624d3aa3686cc896d54acf72","observation_id":"d3dd119b-d654-4d6b-b168-1bdb893da6c2","resolution":{"observed_at":"2026-08-06T23:20:51.997871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:20:52.145353Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.129482025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.145353Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2690f74c67728906616f9f92c0fc670e7c84a77fea04d0de7facc22e74934cad","observation_id":"475ed272-df6e-433f-8369-58ebefe17c1a","resolution":{"observed_at":"2026-08-06T23:20:52.145353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09674","last_updated":"2024-02-15T02:54:49Z","snapshot_observed_at":"2026-08-08T08:35:43.230201Z","submitted_at":"2024-02-15T02:54:49Z","title":"PAL: Proxy-Guided Black-Box Attack on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09674","snapshot_observed_at":"2026-08-06T23:20:52.222527Z","title":"Pal: Proxy-guided black-box attack on large language models.arXiv preprint arXiv:2402.096742024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.222527Z"},"links":{"cited_paper":"/paper/2402.09674","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7195ef5967b36b9c9680fcb879a331ef30934b71c181a756476f20121e9d9ff0","observation_id":"2f51017b-8333-451b-9117-773d2e2a4d40","resolution":{"observed_at":"2026-08-06T23:20:52.222527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T23:20:52.358358Z","title":"Universal and transferable adversarial attacks on aligned language models.arXiv preprint arXiv:2307.150432023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.358358Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:f7667c3d19168df13fa86a70d93cf9bd77a5aced00b01d87d99cb8ece3562330","observation_id":"397bd4f2-0c8f-40b2-bb8e-1e50f9542ab5","resolution":{"observed_at":"2026-08-06T23:20:52.358358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-06T23:20:52.542586Z","title":"Jailbroken: How Does LLM Safety Training Fail?arXiv preprint arXiv:2311.066072023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.542586Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:24f26a4df125fb0428517bbc3976c351bb636f6d8935066571e78fa37b26adc9","observation_id":"cc1567fc-3ba2-4fc9-9c42-1ccde88ab3d8","resolution":{"observed_at":"2026-08-06T23:20:52.542586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.440843Z","title":"A survey of backdoor attacks and defenses on large language models: Implications for security measures.Authorea Preprints2024","venue":null,"work_id":"7a7bd345-5524-4923-be63-4e55486649ba","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.790543Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7378f4b6cda68c5dfda65efbb299df01fa8858294cf4e918a092433f7d1181d8","observation_id":"3cf6324c-550c-4d8a-8cbb-105e3cb79ade","resolution":{"observed_at":"2026-08-06T23:21:04.636289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.198505Z","title":"Training language models to follow instructions with human feedback.NeurIPS2022,35, 27730–27744","venue":null,"work_id":"f8562ed1-acd2-4391-9b04-649426978243","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:52.876347Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:79ac37a0e08953881074c56ed0d6d3d965b406bfeb92670c2840e756d54c29c4","observation_id":"b8189ea6-8014-43c2-9a13-f58b06787a87","resolution":{"observed_at":"2026-08-06T23:21:04.274233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:04.034341Z","title":"Defending Large Language Models Against Jailbreak Attacks Through Chain of Thought Prompting","venue":null,"work_id":"46131251-63dd-480b-ab8d-8d2f081f5e14","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.014644Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:cb60ac8bff4c8ef4641fec56e5f1677fa306d2fd51f9832041c01f0d74ef9be9","observation_id":"c6aa9a52-c618-443e-b245-10472b891979","resolution":{"observed_at":"2026-08-06T23:21:04.119138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.855160Z","title":"Many-shot jailbreaking.NeurIPS2024,37, 129696–129742","venue":null,"work_id":"f62005d0-4d45-481b-b5c2-4a518c2a8e6d","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.104384Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2d06583052fa1778069bc05b199a333bab1badc7216d66068e83ae095248c2cd","observation_id":"ad0c9440-6356-4961-8102-c23bd7bf22f1","resolution":{"observed_at":"2026-08-06T23:21:03.956256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08416","last_updated":"2024-02-13T12:40:39Z","snapshot_observed_at":"2026-07-06T17:29:25.794341Z","submitted_at":"2024-02-13T12:40:39Z","title":"Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08416","snapshot_observed_at":"2026-08-06T23:20:53.234749Z","title":"Pandora: Jailbreak GPTs by Retrieval Augmented Generation Poisoning.CoRR abs/2402.084162024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.234749Z"},"links":{"cited_paper":"/paper/2402.08416","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:0407fa9fe3406e37294ba11fb66b9ffe676189d213be8b86777a642317475ba0","observation_id":"1107255d-f51b-401a-841e-7976b9a6d564","resolution":{"observed_at":"2026-08-06T23:20:53.234749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05197","last_updated":"2023-11-01T05:14:01Z","snapshot_observed_at":"2026-07-06T15:14:24.794122Z","submitted_at":"2023-04-11T13:05:04Z","title":"Multi-step Jailbreaking Privacy Attacks on ChatGPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05197","snapshot_observed_at":"2026-08-06T23:20:53.545039Z","title":"Multi-step jailbreaking privacy attacks on chatgpt.arXiv preprint arXiv:2304.051972023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.545039Z"},"links":{"cited_paper":"/paper/2304.05197","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:e141a183529767f7dc01e18babeda2e4f83e5c42b6a110162ccdcba7704b1fdd","observation_id":"2ec64b4f-08f6-42c6-a595-c514a2f21e81","resolution":{"observed_at":"2026-08-06T23:20:53.545039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14950","last_updated":"2023-10-14T05:03:53Z","snapshot_observed_at":"2026-08-08T00:53:22.080125Z","submitted_at":"2023-05-24T09:40:56Z","title":"Adversarial Demonstration Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14950","snapshot_observed_at":"2026-08-06T23:20:53.674318Z","title":"Adversarial demonstration attacks on large language models.arXiv preprint arXiv:2305.149502023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.674318Z"},"links":{"cited_paper":"/paper/2305.14950","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9065336e8ac0b7f1b7a7826a8ccd1d42a34a31627adf5878064dbbb0dbdea9ef","observation_id":"5b09016f-1598-49f5-8296-9045b92df4b2","resolution":{"observed_at":"2026-08-06T23:20:53.674318Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-06T13:25:52.403871Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-06T23:20:53.797609Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations.arXiv preprint arXiv:2310.063872023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.797609Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:17431d4c282e78587200947b90d2294f1ebbaccb6d1138a2e2a6784f193e2790","observation_id":"acd11a48-ed3f-4c4d-be94-32473105ddd4","resolution":{"observed_at":"2026-08-06T23:20:53.797609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.644414Z","title":"Improved few-shot jailbreaking can circumvent aligned language models and their defenses.NeurIPS2024,37, 32856–32887","venue":null,"work_id":"5007861e-b349-47a3-8694-d79db9837b12","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.856016Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:e01b981287c25575e9defe0fbd7878f7fffbbf857e119f8ffe5fc27d3c170912","observation_id":"8c70371a-3c8c-4c98-8d98-02c6c726e70b","resolution":{"observed_at":"2026-08-06T23:21:03.744360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09091","last_updated":"2024-02-16T10:24:04Z","snapshot_observed_at":"2026-08-09T00:12:09.433196Z","submitted_at":"2024-02-14T11:11:51Z","title":"Play Guessing Game with LLM: Indirect Jailbreak Attack with Implicit Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09091","snapshot_observed_at":"2026-08-06T23:20:53.974751Z","title":"Play guessing game with llm: Indirect jailbreak attack with implicit clues.arXiv preprint arXiv:2402.090912024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:53.974751Z"},"links":{"cited_paper":"/paper/2402.09091","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2a5f3d9b015d7e563304b01e3ad037e85ed8330302de06ed48de4a385b41bfe1","observation_id":"c19d5bb5-90b4-41b0-a6fe-a093ffc61213","resolution":{"observed_at":"2026-08-06T23:20:53.974751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.465569Z","title":"Artprompt: Ascii art-based jailbreak attacks against aligned llms","venue":null,"work_id":"de4dbc75-c883-46f0-bdcb-0e9798996b72","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.051307Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:58c792f441357933f251cadc2648d048fedefd5439aa46c436b72a75dda71e2b","observation_id":"abd74381-d8d7-4181-8228-b93e0156df97","resolution":{"observed_at":"2026-08-06T23:21:03.585017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14872","last_updated":"2024-02-27T13:49:22Z","snapshot_observed_at":"2026-08-06T14:36:18.172649Z","submitted_at":"2024-02-21T15:13:50Z","title":"Semantic Mirror Jailbreak: Genetic Algorithm Based Jailbreak Prompts Against Open-source LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14872","snapshot_observed_at":"2026-08-06T23:20:54.194806Z","title":"Semantic mirror jailbreak: Genetic algorithm based jailbreak prompts against open-source llms.arXiv preprint arXiv:2402.148722024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.194806Z"},"links":{"cited_paper":"/paper/2402.14872","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ab52a4d824ea9fc7436c1e2b3db0333e4f532f0d15b02520096052b80bbe66fb","observation_id":"7934abf5-bb74-4271-a43f-dfa0858bc75c","resolution":{"observed_at":"2026-08-06T23:20:54.194806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03052","last_updated":"2025-05-17T10:47:24Z","snapshot_observed_at":"2026-08-09T10:02:49.089622Z","submitted_at":"2025-02-05T10:29:54Z","title":"Understanding and Enhancing the Transferability of Jailbreaking Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03052","snapshot_observed_at":"2026-08-06T23:20:54.264785Z","title":"Understanding and enhancing the transferability of jailbreaking attacks.arXiv preprint arXiv:2502.030522025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.264785Z"},"links":{"cited_paper":"/paper/2502.03052","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:3106b46d58271027a30c8522551326651bb494fa95cda3866bb408646c542f4c","observation_id":"62c6b020-c4b5-4cfb-ba2b-4431d76ecd1d","resolution":{"observed_at":"2026-08-06T23:20:54.264785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-06T02:57:30.438059Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-06T23:20:54.385546Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.385546Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:4fcf4b88e9a165eaee7fbaebaf37fefdd083f26827001b51a5f45f98210df7de","observation_id":"04bf703d-e726-4859-8139-7bd43ff41a54","resolution":{"observed_at":"2026-08-06T23:20:54.385546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.265620Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":"a60b4910-644c-49d7-a55d-c8739c933c5a","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.467206Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d42498e87b13e9bf631526920b85fc334ee196d62d60525f367ed26b546d8fb9","observation_id":"f737caa1-dd19-4063-b49f-336cf5337eaf","resolution":{"observed_at":"2026-08-06T23:21:03.365496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:03.021547Z","title":"All in how you ask for it: Simple black-box method for jailbreak attacks.Applied Sciences2024,14, 3558","venue":null,"work_id":"a62de087-2033-485a-8fc7-c75e0f7a8ad0","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.614751Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:c10926e8051f17a100b41cbccde9a5e0fab0dc7588fc65c5e5e7db84b1e13e1d","observation_id":"b80279ff-90d9-451b-bac6-6d4c9d7bfbff","resolution":{"observed_at":"2026-08-06T23:21:03.130334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.839256Z","title":"Emoji Attack: Enhancing Jailbreak Attacks Against Judge LLM Detection","venue":null,"work_id":"42984010-dd90-402a-9f77-293713d736d3","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.718877Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:091780bd5763ad7062e3b178e28dc5b2e67862e53f3e3f882551a92cbe7ac44d","observation_id":"66031097-22d5-4869-95db-3bd8274d5547","resolution":{"observed_at":"2026-08-06T23:21:02.924635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11407","last_updated":"2024-11-18T09:28:58Z","snapshot_observed_at":"2026-08-04T04:36:49.174974Z","submitted_at":"2024-11-18T09:28:58Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11407","snapshot_observed_at":"2026-08-06T23:20:54.845285Z","title":"The Dark Side of Trust: Authority Citation-Driven Jailbreak Attacks on Large Language Models.arXiv preprint arXiv:2411.114072024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.845285Z"},"links":{"cited_paper":"/paper/2411.11407","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:3f11ed7c2bfdd3cedad1e3fa1591a0cdec3384c1f31c7d49852d617c994cd41a","observation_id":"572595dc-71e9-4f77-ab83-eafeb7994cbd","resolution":{"observed_at":"2026-08-06T23:20:54.845285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10253","last_updated":"2024-06-27T16:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T02:19:48Z","title":"GPTFUZZER: Red Teaming Large Language Models with Auto-Generated Jailbreak Prompts","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10253","snapshot_observed_at":"2026-08-06T23:20:54.935278Z","title":"Gptfuzzer: Red teaming large language models with auto-generated jailbreak prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:54.935278Z"},"links":{"cited_paper":"/paper/2309.10253","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:7075daf3ac053429b0a92d3c972d6dfa0f559ea8cd78f2a9843d7246dea321df","observation_id":"80a5b13b-f9b0-4d0d-8bd2-195e885fbab4","resolution":{"observed_at":"2026-08-06T23:20:54.935278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.593321Z","title":"Gpt-4 is too smart to be safe: Stealthy chat with llms via cipher2024","venue":null,"work_id":"73bd0356-0ab3-40db-8c39-c9ec210aeeef","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.064753Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ee2f6033dc8f73018bb24113a6741873de45071e43902768fa94ded9d74e3971","observation_id":"fe8b4cf5-c9ed-4ddc-9b02-460cffe25f72","resolution":{"observed_at":"2026-08-06T23:21:02.700975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09442","last_updated":"2023-10-11T00:37:33Z","snapshot_observed_at":"2026-07-06T15:43:11.799806Z","submitted_at":"2023-06-15T18:49:50Z","title":"Explore, Establish, Exploit: Red Teaming Language Models from Scratch","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09442","snapshot_observed_at":"2026-08-06T23:20:55.144189Z","title":"Explore, establish, exploit: Red teaming language models from scratch.arXiv preprint arXiv:2306.094422023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.144189Z"},"links":{"cited_paper":"/paper/2306.09442","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:3f7180db84cc1f22cdb5e33f92130320f6f65d7b1ef92b487d11f410c2446c5b","observation_id":"54a66195-b915-43e4-9959-84fd95786d5c","resolution":{"observed_at":"2026-08-06T23:20:55.144189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.437412Z","title":"Jailbreaking black box large language models in twenty queries","venue":null,"work_id":"951396b6-ad94-4a72-8019-6d570880e973","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.255225Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:5c1f5bf99e8872a5cd7af7fa811d8e2f09f9ef98e9ee99bb23420878151aa0f0","observation_id":"c04a6230-7c1e-48d7-a277-2891647b17b5","resolution":{"observed_at":"2026-08-06T23:21:02.554468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08715","last_updated":"2023-10-25T07:30:51Z","snapshot_observed_at":"2026-07-06T15:54:58.589775Z","submitted_at":"2023-07-16T01:07:15Z","title":"MasterKey: Automated Jailbreak Across Multiple Large Language Model Chatbots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08715","snapshot_observed_at":"2026-08-06T23:20:55.350714Z","title":"Masterkey: Automated jailbreak across multiple large language model chatbots.arXiv preprint arXiv:2307.087152023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.350714Z"},"links":{"cited_paper":"/paper/2307.08715","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:a9fd2c7b67777d7d1b853e5ebff3aa0bcf22e539e4ccd9557f6e0ce71e5a7703","observation_id":"4e48964a-e6cf-40b9-95be-f7f0537b1c4b","resolution":{"observed_at":"2026-08-06T23:20:55.350714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.316876Z","title":"MART: Improving LLM Safety with Multi-round Automatic Red-Teaming","venue":null,"work_id":"b977fdc4-ffe4-481b-a7cb-c6a3d71f32c6","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.425537Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:eb87da79e1bdba564306003328f8537c05dbf313cb7a4cefb12710cf20d7f1f4","observation_id":"55094c79-bba4-4d98-b270-58aefc9fa2a9","resolution":{"observed_at":"2026-08-06T23:21:02.386229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:55.484326Z","title":"Guard: Role-playing to generate natural-language jailbreakings to test guideline adherence of large language models.arXiv preprint arXiv:2402.032992024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.484326Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:70986e20c577ab6dbae59f1e352a0db35c2606b3c34c07a1677d5d453a4e418d","observation_id":"4c262b5e-e8cb-4176-8743-7c89d623960d","resolution":{"observed_at":"2026-08-06T23:20:55.484326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11830","last_updated":"2023-12-08T02:57:26Z","snapshot_observed_at":"2026-08-04T13:05:30.729916Z","submitted_at":"2023-09-21T07:07:49Z","title":"Goal-Oriented Prompt Attack and Safety Evaluation for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11830","snapshot_observed_at":"2026-08-06T23:20:55.602649Z","title":"Goal-oriented prompt attack and safety evaluation for llms.arXiv preprint arXiv:2309.118302023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.602649Z"},"links":{"cited_paper":"/paper/2309.11830","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:5f2ade9ffb9968d41c2aad9363d6e3e1312b7c71c696cbfba811a382af6666a3","observation_id":"1fc88740-52ae-418d-8b91-0abd30c85890","resolution":{"observed_at":"2026-08-06T23:20:55.602649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:02.134762Z","title":"Tree of attacks: Jailbreaking black-box llms automatically.NeurIPS2024,37, 61065–61105","venue":null,"work_id":"d9667784-0bcb-43c2-bc2f-51c211693639","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.752634Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ac33a759968cb7c04725f2a49d2ef531672e6a75d6a745d6db4fe90b2c05b22f","observation_id":"4ed0e8b6-e09e-46ab-8341-c7523c28610e","resolution":{"observed_at":"2026-08-06T23:21:02.212017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03348","last_updated":"2023-11-24T12:50:31Z","snapshot_observed_at":"2026-08-05T10:39:14.391116Z","submitted_at":"2023-11-06T18:55:18Z","title":"Scalable and Transferable Black-Box Jailbreaks for Language Models via Persona Modulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03348","snapshot_observed_at":"2026-08-06T23:20:55.859123Z","title":"Scalable and transferable black-box jailbreaks for language models via persona modulation.arXiv preprint arXiv:2311.033482023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.859123Z"},"links":{"cited_paper":"/paper/2311.03348","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:55395a8647d7ea934597a2c6f72c75ff951f32d0f2ceae1fd15fb8efa910b851","observation_id":"6d906230-1a4e-4b3f-b9a8-854bff233fbf","resolution":{"observed_at":"2026-08-06T23:20:55.859123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.11855","last_updated":"2024-02-02T08:28:01Z","snapshot_observed_at":"2026-08-07T01:32:12.754339Z","submitted_at":"2023-11-20T15:50:09Z","title":"Evil Geniuses: Delving into the Safety of LLM-based Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.11855","snapshot_observed_at":"2026-08-06T23:20:55.953808Z","title":"Evil geniuses: Delving into the safety of llm-based agents.arXiv preprint arXiv:2311.118552023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:55.953808Z"},"links":{"cited_paper":"/paper/2311.11855","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:25877ed12e064f8874940c09d5735667d841534b262782c324442342d05a215c","observation_id":"207ab80e-bb35-4fe7-b1ba-5e6a8bd3c6af","resolution":{"observed_at":"2026-08-06T23:20:55.953808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.919332Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms","venue":null,"work_id":"afe1773f-c4aa-45b7-85e2-7390fb0be189","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.055295Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:16bc399ce93ff32d1a7842e8a48970591d80b82d99bcd679f51e8a70ab60719b","observation_id":"898e97be-5c05-4f88-9ce5-c472c57af4b6","resolution":{"observed_at":"2026-08-06T23:21:02.015166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09154","last_updated":"2025-03-03T09:37:27Z","snapshot_observed_at":"2026-08-03T17:59:18.731227Z","submitted_at":"2024-02-14T13:13:26Z","title":"Attacking Large Language Models with Projected Gradient Descent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09154","snapshot_observed_at":"2026-08-06T23:20:56.204745Z","title":"Attacking large language models with projected gradient descent.arXiv preprint arXiv:2402.091542024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.204745Z"},"links":{"cited_paper":"/paper/2402.09154","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:fa43fd476c3353b3a5880e1a3575a0878117fe973916778e65935781e89fd034","observation_id":"09cebd2c-7789-45e8-89f2-5eb8bf3a0b10","resolution":{"observed_at":"2026-08-06T23:20:56.204745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.828490Z","title":"Query-based adversarial prompt generation.NeurIPS2024, 37, 128260–128279","venue":null,"work_id":"8861d17d-43cf-4946-b389-39dbf168404a","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.319414Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:9bf85de62845a18969df7ebf3bada081d02b546d07e170620ea03d10928461b2","observation_id":"a469243d-98ab-448f-a553-d9a672b4148f","resolution":{"observed_at":"2026-08-06T23:21:01.842246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21018","last_updated":"2024-06-05T16:35:49Z","snapshot_observed_at":"2026-07-06T18:23:23.565502Z","submitted_at":"2024-05-31T17:07:15Z","title":"Improved Techniques for Optimization-Based Jailbreaking on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21018","snapshot_observed_at":"2026-08-06T23:20:56.482120Z","title":"Improved techniques for optimization-based jailbreaking on large language models.arXiv preprint arXiv:2405.210182024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.482120Z"},"links":{"cited_paper":"/paper/2405.21018","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:8edc62908a094ddf7908042f94cf9a7d18f086a85c07b8c75289a84addce9054","observation_id":"d2bfecdd-1356-4824-8494-fac5065e7174","resolution":{"observed_at":"2026-08-06T23:20:56.482120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:56.584927Z","title":"Iterative self-tuning llms for enhanced jailbreaking capabilities.arXiv preprint arXiv:2410.184692024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.584927Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:37f3aa2b001a9374b2d8b5840430a5ab9a571b31b3f1e8b04a227fc865dd3975","observation_id":"2309b2d9-7282-4885-9774-dc260c466e86","resolution":{"observed_at":"2026-08-06T23:20:56.584927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.691354Z","title":"From noise to clarity: Unraveling the adversarial suffix of large language model attacks via translation of text embeddings.CoRR2024","venue":null,"work_id":"2007cb2e-41a0-4fe5-9005-4ee3a8636397","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.742083Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:ab6c3f4cbe85481626a4a8010b296e661dc94ef317bad441ea2607ff18b3012e","observation_id":"980df864-1235-45f1-a729-c8df39e53787","resolution":{"observed_at":"2026-08-06T23:21:01.748411Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01865","last_updated":"2025-02-25T07:47:41Z","snapshot_observed_at":"2026-08-07T17:50:59.593460Z","submitted_at":"2025-02-25T07:47:41Z","title":"Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints","version":1},"cited_work":{"arxiv_id":"2503.01865","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.01865","snapshot_observed_at":"2026-08-06T23:20:59.866363Z","title":"Guiding not Forcing: Enhancing the Transferability of Jailbreaking Attacks on LLMs via Removing Superfluous Constraints","venue":"cs.LG","work_id":"f42921ff-25c1-4023-be35-9b327a922b39","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.844753Z"},"links":{"cited_paper":"/paper/2503.01865","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:fc3d247bd3205aee93fd671abf059b651d07ca0b6d947b7633872ded0cf2734f","observation_id":"0f629e3d-fe27-4fae-93c7-e2ab5756f978","resolution":{"observed_at":"2026-08-06T23:21:00.004770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15140","last_updated":"2023-12-14T06:22:51Z","snapshot_observed_at":"2026-08-03T19:47:58.067345Z","submitted_at":"2023-10-23T17:46:07Z","title":"AutoDAN: Interpretable Gradient-Based Adversarial Attacks on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15140","snapshot_observed_at":"2026-08-06T23:20:56.924751Z","title":"AutoDAN: interpretable gradient-based adversarial attacks on large language models.arXiv preprint arXiv:2310.151402023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:56.924751Z"},"links":{"cited_paper":"/paper/2310.15140","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d4ef78c0b1bfaf4cf89c81c21e031d0110c9c5c25366b3a2bffe9b969b2a1ffa","observation_id":"73d991a7-641e-443f-9e8e-375b9bf881d5","resolution":{"observed_at":"2026-08-06T23:20:56.924751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04127","last_updated":"2024-02-23T07:32:27Z","snapshot_observed_at":"2026-08-09T10:09:53.270264Z","submitted_at":"2023-12-07T08:29:58Z","title":"Analyzing the Inherent Response Tendency of LLMs: Real-World Instructions-Driven Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04127","snapshot_observed_at":"2026-08-06T23:20:57.014753Z","title":"Analyzing the inherent response tendency of llms: Real-world instructions- driven jailbreak.arXiv preprint arXiv:2312.041272023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.014753Z"},"links":{"cited_paper":"/paper/2312.04127","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:e5257f83ecb846926f5abc5eba7d4c05b58b1bd7ea6fd7eecad05825143748cc","observation_id":"f2de84f1-870e-469e-b6f7-00b81abe62f6","resolution":{"observed_at":"2026-08-06T23:20:57.014753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.498026Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","venue":null,"work_id":"906fd147-a952-42db-84c2-1fe73dea832f","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.106875Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:403d929d3703e51f13bf19b1a6f3bf1c00c87c6429303c3f30bea200bf921c01","observation_id":"d6c92b03-eb4c-412c-a676-26de960e4f10","resolution":{"observed_at":"2026-08-06T23:21:01.592880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09125","last_updated":"2024-11-14T01:48:08Z","snapshot_observed_at":"2026-07-06T19:50:05.918060Z","submitted_at":"2024-11-14T01:48:08Z","title":"DROJ: A Prompt-Driven Attack against Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09125","snapshot_observed_at":"2026-08-06T23:20:57.184523Z","title":"Droj: A prompt-driven attack against large language models.arXiv preprint arXiv:2411.091252024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.184523Z"},"links":{"cited_paper":"/paper/2411.09125","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:0b9d6e2034cd78c5ead8d792b61a379e6c554e23657f2608481c2d4b0cdd96a4","observation_id":"4340b1d7-49c0-436b-84dc-94c912fa73fd","resolution":{"observed_at":"2026-08-06T23:20:57.184523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.313401Z","title":"Catastrophic jailbreak of open-source llms via exploiting generation","venue":null,"work_id":"b0b1dc52-c735-4ce0-8940-c4177be199d6","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.318459Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:c4daacde7cfbf1f46f43e81adc4016518a66dfb7f111ac6beb69a8f9fcc5a3d9","observation_id":"31f963ff-fdbe-4b35-b7e8-2b9f30b76df0","resolution":{"observed_at":"2026-08-06T23:21:01.378863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04782","last_updated":"2023-12-08T01:41:36Z","snapshot_observed_at":"2026-08-09T19:54:55.776897Z","submitted_at":"2023-12-08T01:41:36Z","title":"Make Them Spill the Beans! Coercive Knowledge Extraction from (Production) LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04782","snapshot_observed_at":"2026-08-06T23:20:57.420571Z","title":"Make them spill the beans! coercive knowledge extraction from (production) llms.arXiv preprint arXiv:2312.047822023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.420571Z"},"links":{"cited_paper":"/paper/2312.04782","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:a13919876363df089427c8f29108d0b6e7853573255bd9b9a01421a4bb8f7348","observation_id":"dbf5d646-15db-44cb-995c-4f51ac048dd8","resolution":{"observed_at":"2026-08-06T23:20:57.420571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17256","last_updated":"2025-07-23T18:43:18Z","snapshot_observed_at":"2026-07-06T17:22:41.286422Z","submitted_at":"2024-01-30T18:48:37Z","title":"Weak-to-Strong Jailbreaking on Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17256","snapshot_observed_at":"2026-08-06T23:20:57.504508Z","title":"Weak-to-strong jailbreaking on large language models.arXiv preprint arXiv:2401.172562024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.504508Z"},"links":{"cited_paper":"/paper/2401.17256","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:458c856162d6e62f3c2850216d7e5e25b24b0de91cf1bdc4e14b0b974aa973f6","observation_id":"31368c05-277e-4bbf-b0e3-6e2c92dff6f8","resolution":{"observed_at":"2026-08-06T23:20:57.504508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16369","last_updated":"2025-07-02T07:27:32Z","snapshot_observed_at":"2026-08-07T21:23:08.873449Z","submitted_at":"2024-04-25T07:15:23Z","title":"Don't Say No: Jailbreaking LLM by Suppressing Refusal","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16369","snapshot_observed_at":"2026-08-06T23:20:57.656839Z","title":"Don’t say no: Jailbreaking llm by suppressing refusal.arXiv preprint arXiv:2404.163692024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.656839Z"},"links":{"cited_paper":"/paper/2404.16369","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:74e9935e0e81d0ce4e6e0dd9125f4fcc5e1b80bbfe20e16350733c9cca7bda39","observation_id":"42a48662-4628-4735-83ee-9602c01ffcd3","resolution":{"observed_at":"2026-08-06T23:20:57.656839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-06T23:20:57.744842Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to!arXiv preprint arXiv:2310.036932023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.744842Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:fc1ac7c7998ec6d7dc8f2f730031eb7405bfe220645d7560e2236585b8a1b085","observation_id":"42f69fb9-0057-4e6d-88e6-42a3df17cf2d","resolution":{"observed_at":"2026-08-06T23:20:57.744842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02949","last_updated":"2023-10-04T16:39:31Z","snapshot_observed_at":"2026-08-07T11:20:01.991656Z","submitted_at":"2023-10-04T16:39:31Z","title":"Shadow Alignment: The Ease of Subverting Safely-Aligned Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02949","snapshot_observed_at":"2026-08-06T23:20:57.826882Z","title":"Shadow alignment: The ease of subverting safely-aligned language models.arXiv preprint arXiv:2310.029492023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.826882Z"},"links":{"cited_paper":"/paper/2310.02949","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:06cc873e31c88636ae5f6ab062b5d246f2042d928a18d183cc208629811c89a6","observation_id":"8423a4ca-4720-4e34-9c9a-ca8ba783decd","resolution":{"observed_at":"2026-08-06T23:20:57.826882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05553","last_updated":"2024-04-05T23:30:56Z","snapshot_observed_at":"2026-08-07T23:30:34.877117Z","submitted_at":"2023-11-09T17:54:59Z","title":"Removing RLHF Protections in GPT-4 via Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05553","snapshot_observed_at":"2026-08-06T23:20:57.988075Z","title":"Removing rlhf protections in gpt-4 via fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:57.988075Z"},"links":{"cited_paper":"/paper/2311.05553","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:f3ed8cf28d77e4a781173f0e13ab81d5903a3120ce4ae4097e2844813dbbbfc0","observation_id":"ab1d7d35-a32d-4fb2-9219-90097f0a8d86","resolution":{"observed_at":"2026-08-06T23:20:57.988075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-06T23:20:58.119677Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal.arXiv preprint arXiv:2402.042492024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.119677Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:2a95e1a75adaafac27ae1550c2fab81f7c3f6978acc4d848c4fa3f3b5021f3be","observation_id":"685c4854-50a5-45aa-9108-651a18eea961","resolution":{"observed_at":"2026-08-06T23:20:58.119677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12171","last_updated":"2024-03-18T18:39:53Z","snapshot_observed_at":"2026-08-06T21:46:54.063328Z","submitted_at":"2024-03-18T18:39:53Z","title":"EasyJailbreak: A Unified Framework for Jailbreaking Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12171","snapshot_observed_at":"2026-08-06T23:20:58.217814Z","title":"Easyjailbreak: A unified framework for jailbreaking large language models.arXiv preprint arXiv:2403.121712024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.217814Z"},"links":{"cited_paper":"/paper/2403.12171","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:82c519f3430fd29791735fa83cc6d71295bad88a7d046ec119b709c1cbccdf9d","observation_id":"8ace8b2b-0596-49af-b719-c484030b59f7","resolution":{"observed_at":"2026-08-06T23:20:58.217814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12762","last_updated":"2024-11-27T07:41:35Z","snapshot_observed_at":"2026-07-06T19:52:46.580689Z","submitted_at":"2024-11-16T13:07:13Z","title":"Playing Language Game with LLMs Leads to Jailbreaking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12762","snapshot_observed_at":"2026-08-06T23:20:58.265798Z","title":"Playing language game with llms leads to jailbreaking.arXiv preprint arXiv:2411.127622024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.265798Z"},"links":{"cited_paper":"/paper/2411.12762","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:10b1b21ef93647deea41ae38640cd880336ad32a0d32987c83c8a8842bf9961c","observation_id":"d8e38e2c-5701-411c-be1a-3df3c7fb0434","resolution":{"observed_at":"2026-08-06T23:20:58.265798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.151395Z","title":"do anything now","venue":null,"work_id":"c99e4f08-1b7f-4687-b9d5-45cbada268cf","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.301037Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:843ce12fc49d6f6162c70b269d2c82fa5181a397b2ad9c222ff7ec3754dd6f37","observation_id":"8453da1f-f303-4dfc-a528-6b3a81731ada","resolution":{"observed_at":"2026-08-06T23:21:01.234729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:58.396202Z","title":"Chain-of-Lure: A Synthetic Narrative-Driven Approach to Compromise Large Language Models.arXiv preprint arXiv:2505.175192025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.396202Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:47076d9c840a88857f74370d8d3a16186d1e57f8a3c03423aedd9a0a947541c2","observation_id":"9d70e8b5-b0ee-4355-816b-25171df3f631","resolution":{"observed_at":"2026-08-06T23:20:58.396202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11054","last_updated":"2025-03-11T03:06:17Z","snapshot_observed_at":"2026-08-09T20:00:14.440806Z","submitted_at":"2025-02-16T09:27:44Z","title":"Reasoning-Augmented Conversation for Multi-Turn Jailbreak Attacks on Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11054","snapshot_observed_at":"2026-08-06T23:20:58.435774Z","title":"Reasoning-augmented conversation for multi-turn jailbreak attacks on large language models.arXiv preprint arXiv:2502.110542025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.435774Z"},"links":{"cited_paper":"/paper/2502.11054","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:53e61d8fd5ba3d84c01144972c535689b0dedee67a2adb81100c7e6072ec401f","observation_id":"9cfac2d0-946a-46f1-b1ce-98acfb8deaf1","resolution":{"observed_at":"2026-08-06T23:20:58.435774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16489","last_updated":"2025-04-23T08:01:50Z","snapshot_observed_at":"2026-08-07T15:59:58.600059Z","submitted_at":"2025-04-23T08:01:50Z","title":"Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16489","snapshot_observed_at":"2026-08-06T23:20:58.553566Z","title":"Amplified Vulnerabilities: Structured Jailbreak Attacks on LLM-based Multi-Agent Debate.arXiv preprint arXiv:2504.164892025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.553566Z"},"links":{"cited_paper":"/paper/2504.16489","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:392959ea0fe432cfffd5a0d4dbb5efdfb1241824b7f227c6fe54970b135bdc41","observation_id":"12e3a4ea-66ab-4847-8f75-b609b11b7db2","resolution":{"observed_at":"2026-08-06T23:20:58.553566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12893","last_updated":"2025-02-27T01:32:58Z","snapshot_observed_at":"2026-08-07T18:08:32.968901Z","submitted_at":"2025-02-18T14:29:12Z","title":"H-CoT: Hijacking the Chain-of-Thought Safety Reasoning Mechanism to Jailbreak Large Reasoning Models, Including OpenAI o1/o3, DeepSeek-R1, and Gemini 2.0 Flash Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12893","snapshot_observed_at":"2026-08-06T23:20:58.633864Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.633864Z"},"links":{"cited_paper":"/paper/2502.12893","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:94d3ebfb9c0b68c4be962b8a769be10d44945944dec920f249c2f01a47fa27c9","observation_id":"a5edf243-33c2-4ba1-a47c-b019af836f53","resolution":{"observed_at":"2026-08-06T23:20:58.633864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21972","last_updated":"2025-06-27T07:26:33Z","snapshot_observed_at":"2026-08-09T11:01:32.991049Z","submitted_at":"2025-06-27T07:26:33Z","title":"Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21972","snapshot_observed_at":"2026-08-06T23:20:58.767251Z","title":"Advancing Jailbreak Strategies: A Hybrid Approach to Exploiting LLM Vulnerabilities and Bypassing Modern Defenses.arXiv preprint arXiv:2506.219722025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.767251Z"},"links":{"cited_paper":"/paper/2506.21972","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d27b2bb4f4fb4b2480b7304c88c5702d680144148764a2f0b7e6ecbf1969b77f","observation_id":"5da767d8-d948-43cd-ae62-0c59201e73a0","resolution":{"observed_at":"2026-08-06T23:20:58.767251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:01.009432Z","title":"Gradient cuff: Detecting jailbreak attacks on large language models by exploring refusal loss landscapes.NeurIPS2024,37, 126265–126296","venue":null,"work_id":"d72f9a5f-f7e3-407f-bae6-ac4048bccfbd","year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.874995Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:6ae3d7f714339c8cdf40c5bd998d495d04c9a686218cf62645aae193c1bcb5d6","observation_id":"780df3e5-5c8b-4e64-9949-794827c298c4","resolution":{"observed_at":"2026-08-06T23:21:01.066495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:00.715881Z","title":"JBShield: Defending Large Language Models from Jailbreak Attacks through Activated Concept Analysis and Manipulation","venue":null,"work_id":"af9925d3-7004-4c60-89af-2d43f8112930","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:58.957828Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:650ce1efa8ed1379ae82902d7b575e6dae2c360a9f40e5698c981ee1dbe6afdc","observation_id":"4b26e0de-d342-4c23-b32a-554f30637313","resolution":{"observed_at":"2026-08-06T23:21:00.942413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:20:59.040436Z","title":"The hidden risks of large reasoning models: A safety assessment of r1.arXiv preprint arXiv:2502.126592025","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.040436Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:d8f7cb6ea101e46c8d57952e5c1f3ca63a242b3f4bcc761088e0b9010727f342","observation_id":"acc9b9a0-018d-4138-8dfa-666ea874745b","resolution":{"observed_at":"2026-08-06T23:20:59.040436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:21:00.538597Z","title":"Scaling Trends in Language Model Robustness","venue":null,"work_id":"5fda4e3f-579b-4b55-9a00-42a01c3cc7e8","year":2025},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.108858Z"},"links":{"citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:88fe140285db16e86f3b9241f3c2ebabebbd63e00ff2b990bbe03f75962aa0e1","observation_id":"8625a784-0c3b-4c2e-903f-810fca884fe2","resolution":{"observed_at":"2026-08-06T23:21:00.662149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09832","last_updated":"2024-03-14T19:39:10Z","snapshot_observed_at":"2026-08-04T13:21:37.312302Z","submitted_at":"2024-03-14T19:39:10Z","title":"Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks","version":1},"cited_work":{"arxiv_id":"2403.09832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09832","snapshot_observed_at":"2026-08-06T23:20:59.312542Z","title":"Scaling Behavior of Machine Translation with Large Language Models under Prompt Injection Attacks","venue":"cs.CL","work_id":"5d68993e-844c-4be1-a4ee-92dabe954e4b","year":2024},"citing_paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T23:20:59.199192Z"},"links":{"cited_paper":"/paper/2403.09832","citing_paper":"/paper/2506.18543"},"observation_digest":"sha256:00a56ba4fdae45e82ff30f729ed995a6d843fac7601d3abcd59a33c3c0979b85","observation_id":"9d2998c7-079e-4b37-8077-327cbdf5afaf","resolution":{"observed_at":"2026-08-06T23:20:59.349100Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.18543","last_updated":"2026-05-25T10:15:56Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T08:35:45.497926Z","submitted_at":"2025-06-23T11:53:31Z","title":"SoK: A Comprehensive Security Analysis of Jailbreak Resilience in GPT and DeepSeek Models"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2506.18543."}