{"as_of":"2026-08-08T13:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24fdb86ee5874dc8a52106cf0ca905984bd0030b39c6966610118164a6f4897f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:17:01.577794Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2407.04295","last_updated":"2024-08-30T11:57:47Z","snapshot_observed_at":"2026-08-04T23:34:13.332065Z","submitted_at":"2024-07-05T06:57:30Z","title":"Jailbreak Attacks and Defenses Against Large Language Models: A Survey","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-15T02:20:44.368219Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2407.04295"},"observation_digest":"sha256:af0c8c33b88658393ee277dc402a2301b198de08edcdd85bf820f620475b97a3","observation_id":"d6611326-d04b-4e0e-a9eb-3c0a32f7beac","resolution":{"observed_at":"2026-05-15T02:20:44.644037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2408.12935","last_updated":"2026-05-13T07:56:42Z","snapshot_observed_at":"2026-08-02T12:48:59.218457Z","submitted_at":"2024-08-23T09:33:48Z","title":"AI Safety Landscape for Large Language Models: Taxonomy, State-of-the-art, and Future Directions","version":4},"reference_index":261,"source":"pdf_text","source_observed_at":"2026-05-23T21:54:26.670284Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2408.12935"},"observation_digest":"sha256:fe274d38dd6a1bedbed0a462417d7875ab168a06fb04d38428594b0a7ea9f71d","observation_id":"20571498-ca2c-4d01-b1ad-cf4779b735d0","resolution":{"observed_at":"2026-05-23T21:55:49.827489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2502.01241","last_updated":"2026-04-13T12:56:05Z","snapshot_observed_at":"2026-07-06T20:30:12.663808Z","submitted_at":"2025-02-03T11:02:30Z","title":"Peering Behind the Shield: Guardrail Identification in Large Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T03:45:14.234545Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2502.01241"},"observation_digest":"sha256:87044bfca4d68c0b2d9209772aa7eb849dc9611744ace5970eeaa06854250db5","observation_id":"0dcd471c-92c4-46e6-8864-473a96d2d4d7","resolution":{"observed_at":"2026-05-23T03:45:21.421463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-08T11:17:01.577794Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07987","last_updated":"2025-06-04T18:10:51Z","snapshot_observed_at":"2026-08-08T11:11:03.867295Z","submitted_at":"2025-02-11T22:07:47Z","title":"Universal Adversarial Attack on Aligned Multimodal LLMs","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T11:17:01.577794Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2502.07987"},"observation_digest":"sha256:87ea4588b75ddd779529d3faf636b3c3d19c6512e298abdbd27f4893ac27f4a6","observation_id":"8a28ffb6-f22f-4ade-aba3-4914e6ba9bfe","resolution":{"observed_at":"2026-08-08T11:17:01.577794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T19:45:18.513844Z","title":"Figstep: Jailbreaking large vision-language models 20 via typographic visual prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.14881","last_updated":"2025-02-14T08:42:43Z","snapshot_observed_at":"2026-08-07T22:02:21.919237Z","submitted_at":"2025-02-14T08:42:43Z","title":"A Survey of Safety on Large Vision-Language Models: Attacks, Defenses and Evaluations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T19:45:18.513844Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2502.14881"},"observation_digest":"sha256:754715a84065705d943d1e647b034b9f1dd8f5c7ac93907d0acb6efd2c5a6dbf","observation_id":"2b4a0320-2e8a-4784-bf05-44489b5580c7","resolution":{"observed_at":"2026-08-07T19:45:18.513844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2503.06223","last_updated":"2026-08-06T06:47:13Z","snapshot_observed_at":"2026-08-08T12:16:17.172393Z","submitted_at":"2025-03-08T13:51:40Z","title":"RedDiffuser: Auditing Multimodal Safety Failures in Vision-Language Models via Reinforced Diffusion","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T00:13:08.603115Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2503.06223"},"observation_digest":"sha256:14568039934b582292250d4b85dc0aa7c07b53bf16cc48fb018d90c230058075","observation_id":"a447fef4-d575-4fbf-b5c6-439c13bc93bd","resolution":{"observed_at":"2026-05-23T00:15:14.901879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T14:56:50.049188Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts.arXiv preprint arXiv:2311.05608, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16916","last_updated":"2025-05-22T17:11:58Z","snapshot_observed_at":"2026-08-08T11:53:11.066721Z","submitted_at":"2025-05-22T17:11:58Z","title":"Backdoor Cleaning without External Guidance in MLLM Fine-tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:50.049188Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.16916"},"observation_digest":"sha256:4fe2a8ab1818d2341de6161e963828906a6cbd9b6e5256a6a4aaf2a324578e8e","observation_id":"103793a0-decc-44e8-bd1a-2f4d876afd11","resolution":{"observed_at":"2026-08-07T14:56:50.049188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T14:27:05.699522Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18864","last_updated":"2025-05-24T20:46:36Z","snapshot_observed_at":"2026-08-08T00:24:14.677549Z","submitted_at":"2025-05-24T20:46:36Z","title":"Audio Jailbreak Attacks: Exposing Vulnerabilities in SpeechGPT in a White-Box Framework","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:27:05.699522Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.18864"},"observation_digest":"sha256:85efbc8fc67c762bd4db9b37a93ec14a3e5e99978a8218cc50c0e95ec3fca21a","observation_id":"0a8124b6-20c0-41e0-a7c7-ed3b7ee9bce7","resolution":{"observed_at":"2026-08-07T14:27:05.699522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T14:13:11.421412Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20362","last_updated":"2025-05-26T09:01:46Z","snapshot_observed_at":"2026-08-07T14:05:21.829543Z","submitted_at":"2025-05-26T09:01:46Z","title":"VSCBench: Bridging the Gap in Vision-Language Model Safety Calibration","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:13:11.421412Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.20362"},"observation_digest":"sha256:0709bb80f9511c23d36ef456c72f11f67ed7d5ddc40a2b0d0364397e15ef97fd","observation_id":"4ff5cd9d-7983-411d-a328-87439cb68029","resolution":{"observed_at":"2026-08-07T14:13:11.421412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T13:22:00.808067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.808067Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:dd42b0872ff78887d39454a2d8af5b94716e37f78cc308437e6e47583abbb6e4","observation_id":"154a0da8-bb06-4901-b630-d98a7539b344","resolution":{"observed_at":"2026-08-07T13:22:00.808067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T13:17:20.261903Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts.arXiv preprint arXiv:2311.05608, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22271","last_updated":"2025-05-28T11:57:46Z","snapshot_observed_at":"2026-08-07T13:09:00.589520Z","submitted_at":"2025-05-28T11:57:46Z","title":"Test-Time Immunization: A Universal Defense Framework Against Jailbreaks for (Multimodal) Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:20.261903Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.22271"},"observation_digest":"sha256:5e3344991c885afbf3d151d2012af08275a48f92aed00df7cf9c34dcdf3745db","observation_id":"c9a16fcf-f021-4a0c-a6cb-addc007f4cbc","resolution":{"observed_at":"2026-08-07T13:17:20.261903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:34:37.104583Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts.arXiv preprint arXiv:2311.05608, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24232","last_updated":"2025-05-30T05:48:50Z","snapshot_observed_at":"2026-08-07T12:26:05.850027Z","submitted_at":"2025-05-30T05:48:50Z","title":"From Hallucinations to Jailbreaks: Rethinking the Vulnerability of Large Foundation Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:34:37.104583Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.24232"},"observation_digest":"sha256:989d9d2fecd6c10fc61ed36ee5dc4064641df79d08aeebeedcabab6a4cbb77b7","observation_id":"197b9f6a-0da3-4cf5-a240-b7adcd798e32","resolution":{"observed_at":"2026-08-07T12:34:37.104583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:35:26.878499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24519","last_updated":"2025-05-30T12:30:50Z","snapshot_observed_at":"2026-08-07T12:17:21.702915Z","submitted_at":"2025-05-30T12:30:50Z","title":"AMIA: Automatic Masking and Joint Intention Analysis Makes LVLMs Robust Jailbreak Defenders","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:26.878499Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.24519"},"observation_digest":"sha256:b5117ce0f5397259d3b2b9d1a340cfa7c36999fdad884950086b1001e034ff70","observation_id":"15745a6e-fa80-4aa0-b09a-8879aa8366e6","resolution":{"observed_at":"2026-08-07T12:35:26.878499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T12:07:59.166840Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00548","last_updated":"2025-05-31T13:11:14Z","snapshot_observed_at":"2026-08-08T10:05:29.642578Z","submitted_at":"2025-05-31T13:11:14Z","title":"Con Instruction: Universal Jailbreaking of Multimodal Large Language Models via Non-Textual Modalities","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:07:59.166840Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2506.00548"},"observation_digest":"sha256:b39413d566b1609a4fe67867eea42a40765c99861e72a65a3a8b862db3a194ed","observation_id":"dacb2f80-318f-4ac3-bbe4-bcd682011472","resolution":{"observed_at":"2026-08-07T12:07:59.166840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-06T19:46:25.203611Z","title":"& Wang, X","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04673","last_updated":"2026-07-11T20:48:21Z","snapshot_observed_at":"2026-08-06T19:40:14.478360Z","submitted_at":"2025-07-07T05:35:21Z","title":"Trojan Horse Prompting: Jailbreaking Conversational Multimodal Models by Forging Assistant Message","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:25.203611Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2507.04673"},"observation_digest":"sha256:5a834f2c3ec3975446cec324442e97d1141616b68adf109b9339d170f594586c","observation_id":"68b78950-31ea-4ae7-a11a-c446900e07a2","resolution":{"observed_at":"2026-08-06T19:46:25.203611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-06T19:46:11.544437Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-08T05:08:17.649592Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.544437Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:523f8a9bf649f7a3821462dbb8fd7e4b07541e80208acbe7dca24a0e9a9bb031","observation_id":"646bbd30-5388-4171-9b02-5d93ffeb2371","resolution":{"observed_at":"2026-08-06T19:46:11.544437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-06T17:21:35.208807Z","title":"Fig- Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-06T17:12:51.246126Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.208807Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:f4545d61dd34fe716708d29e79e8f9fed7ae070d7ca9b489e6f68e25d8730242","observation_id":"d549b25a-4dac-4f19-9750-9debf0272fd8","resolution":{"observed_at":"2026-08-06T17:21:35.208807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-06T12:40:05.291273Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21637","last_updated":"2025-07-29T09:48:57Z","snapshot_observed_at":"2026-08-07T14:28:15.638129Z","submitted_at":"2025-07-29T09:48:57Z","title":"Self-Aware Safety Augmentation: Leveraging Internal Semantic Understanding to Enhance Safety in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:40:05.291273Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2507.21637"},"observation_digest":"sha256:4c30aed985112bacca696bfc6d8e6834b1500adf2f057ae4dc72c9cf9699a840","observation_id":"4f27bd73-024c-4e13-adfe-8123bb08ea74","resolution":{"observed_at":"2026-08-06T12:40:05.291273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-06T12:09:39.668500Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22037","last_updated":"2025-07-29T17:39:48Z","snapshot_observed_at":"2026-08-06T15:54:16.679483Z","submitted_at":"2025-07-29T17:39:48Z","title":"Secure Tug-of-War (SecTOW): Iterative Defense-Attack Training with Reinforcement Learning for Multimodal Model Security","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T12:09:39.668500Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2507.22037"},"observation_digest":"sha256:cf5d9cecf2131a675b08b36b8b4c88022c96d924cc4f8114089ff2e87c96cd81","observation_id":"ebab30ad-0dee-4a65-835b-e9d800498ce6","resolution":{"observed_at":"2026-08-06T12:09:39.668500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T22:21:02.779195Z","title":"Figstep: Jailbreaking large vision- language models via typographic visual prompts.arXiv preprint arXiv:2311.05608,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09206","last_updated":"2025-08-10T00:55:54Z","snapshot_observed_at":"2026-08-08T07:38:57.527462Z","submitted_at":"2025-08-10T00:55:54Z","title":"The First Differentiable Transfer-Based Algorithm for Discrete MicroLED Repair","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:21:02.779195Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2508.09206"},"observation_digest":"sha256:dc171602cab21e18b3ee386f0c4cf5b4b5da652aecb2267f28a304c4d9579f91","observation_id":"d510cf0d-ca3a-4b04-b357-685170176142","resolution":{"observed_at":"2026-08-05T22:21:02.779195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T21:22:36.936309Z","title":"Figstep: Jailbreaking large vision- language models via typographic visual prompts.arXiv preprint arXiv:2311.05608,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09237","last_updated":"2025-08-12T12:11:43Z","snapshot_observed_at":"2026-08-07T11:30:49.570543Z","submitted_at":"2025-08-12T12:11:43Z","title":"Blockchain Network Analysis using Quantum Inspired Graph Neural Networks & Ensemble Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T21:22:36.936309Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2508.09237"},"observation_digest":"sha256:834f45bdb02a3ba44c1dda865b18d5b4253f7b8f534ff1371655eedc7d1c04cb","observation_id":"a9d54ccb-3003-4fc0-aa8a-ac732c816833","resolution":{"observed_at":"2026-08-05T21:22:36.936309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T20:31:43.152848Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10404","last_updated":"2025-08-14T07:12:44Z","snapshot_observed_at":"2026-08-08T02:31:17.622343Z","submitted_at":"2025-08-14T07:12:44Z","title":"Layer-Wise Perturbations via Sparse Autoencoders for Adversarial Text Generation","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.152848Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2508.10404"},"observation_digest":"sha256:d73b37245376d8f95761e8541437cb8aa733ae9ffecfb5fa06cff94923d78c81","observation_id":"5740cbd4-b93f-4ade-b1a0-87b323e0e519","resolution":{"observed_at":"2026-08-05T20:31:43.152848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T13:44:55.849334Z","title":"Xingang Guo, Fangxu Yu, Huan Zhang, Lianhui Qin, and Bin Hu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00373","last_updated":"2025-08-30T06:00:53Z","snapshot_observed_at":"2026-08-05T13:44:53.225141Z","submitted_at":"2025-08-30T06:00:53Z","title":"Activation Steering Meets Preference Optimization: Defense Against Jailbreaks in Vision Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T13:44:55.849334Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2509.00373"},"observation_digest":"sha256:fa616597f1ae386bef9809771694d6e161d1c091553a591081a57949418e05cb","observation_id":"c4b7143d-a5e2-4c76-abb8-656d7930f615","resolution":{"observed_at":"2026-08-05T13:44:55.849334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-03T01:22:20.345146Z","title":"A., Ma, W.-C., and Krishna, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.10179","last_updated":"2026-06-26T07:21:53Z","snapshot_observed_at":"2026-08-07T01:08:46.321729Z","submitted_at":"2026-02-10T18:59:55Z","title":"When the Prompt Becomes Visual: Vision-Centric Jailbreak Attacks for Large Image Editing Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T01:22:20.345146Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2602.10179"},"observation_digest":"sha256:b3a7ac3dca0117a11de8b1322fdb537b24161086d292412413760bd3f49d73c5","observation_id":"065152dd-2878-42c2-ae83-a853d098f144","resolution":{"observed_at":"2026-08-03T01:22:20.345146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2604.07754","last_updated":"2026-04-09T03:20:29Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T03:20:29Z","title":"The Art of (Mis)alignment: How Fine-Tuning Methods Effectively Misalign and Realign LLMs in Post-Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:56.476698Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2604.07754"},"observation_digest":"sha256:2730f69f8d83220703c986319e467a80030087cdc885e33f1056ac2ec33f122a","observation_id":"c782b4e9-3165-442d-a618-76714429a737","resolution":{"observed_at":"2026-05-11T00:45:50.717999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2604.25102","last_updated":"2026-04-28T01:21:47Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T01:21:47Z","title":"One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T17:24:05.847988Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2604.25102"},"observation_digest":"sha256:4c7b14a24d2bcd153f4513551c9e079db616410c0f2e28b89da9643392ff224e","observation_id":"33eee8d1-b51e-4d1d-ac56-a4ab45110693","resolution":{"observed_at":"2026-05-11T23:21:15.062154Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2605.01449","last_updated":"2026-05-02T13:56:50Z","snapshot_observed_at":"2026-08-03T12:34:05.607551Z","submitted_at":"2026-05-02T13:56:50Z","title":"VisInject: Disruption != Injection -- A Dual-Dimension Evaluation of Universal Adversarial Attacks on Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:48.999632Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2605.01449"},"observation_digest":"sha256:ac56b8813d7e6f727293e9a794b41b52ecce6571c9285181a578b2d05788fb90","observation_id":"c4d9e311-7b61-4e74-90e8-cf1d6cfc511a","resolution":{"observed_at":"2026-05-11T16:56:08.044730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2605.10582","last_updated":"2026-05-11T13:54:26Z","snapshot_observed_at":"2026-08-06T09:00:38.839501Z","submitted_at":"2026-05-11T13:54:26Z","title":"Guaranteed Jailbreaking Defense via Disrupt-and-Rectify Smoothing","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T04:50:08.866969Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2605.10582"},"observation_digest":"sha256:66af254ce83d1e000738d310e95371927263328e9a70dd36c43914fa56da0ec7","observation_id":"1a793493-6053-4015-b0b5-66b60f0b1867","resolution":{"observed_at":"2026-05-12T05:51:27.613031Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2606.09125","last_updated":"2026-06-08T07:19:42Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T07:19:42Z","title":"Unveiling Privacy Risks in Multi-modal Large Language Models: Task-specific Vulnerabilities and Mitigation Challenges","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-06-27T16:33:28.848573Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2606.09125"},"observation_digest":"sha256:cfb29366bdac7d816dd2a0655835d6f8f37be77ec2d13db7e0a8c7b1f7da477f","observation_id":"52479ce2-430d-4a5a-9cd6-745d42dcee2e","resolution":{"observed_at":"2026-07-03T01:27:31.023210Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":"2311.05608","doi":"10.48550/arxiv.2311.05608","metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fig- 8 Step: Jailbreaking Large Vision-language Models via Typo- graphic Visual Prompts","venue":"arXiv (Cornell University)","work_id":"a22bae88-36b5-4770-bbd4-3cca6b0a8d42","year":2025},"citing_paper":{"arxiv_id":"2606.26566","last_updated":"2026-06-25T03:32:12Z","snapshot_observed_at":"2026-08-03T17:22:40.185111Z","submitted_at":"2026-06-25T03:32:12Z","title":"Adversarial Diffusion Across Modalities: A Fusion Survey of Attacks, Defenses, and Evaluation for Text, Vision, and Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T04:35:51.583460Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2606.26566"},"observation_digest":"sha256:d7cdd9c3a3532f4a223d91b79d6167330330ceb035307f7f1f688171c41482b0","observation_id":"cce14d1e-e0ed-4e91-be22-99cc7cca0d5a","resolution":{"observed_at":"2026-06-26T04:38:59.203237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-02T15:02:59.139372Z","title":"Gou, Y ., Chen, K., Liu, Z., Hong, L., Xu, H., Li, Z., Yeung, D.-Y ., Kwok, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21600","last_updated":"2026-05-03T19:21:06Z","snapshot_observed_at":"2026-08-06T09:31:16.482834Z","submitted_at":"2026-05-03T19:21:06Z","title":"Securing Multimodal AI through Internal Information Decomposition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T15:02:59.139372Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2607.21600"},"observation_digest":"sha256:32707480b316d2250d4d50624a04dcd4454d7282973b3e9abf8c13aeff2a534c","observation_id":"bfae213e-9029-4b58-954f-127a92ef4fd2","resolution":{"observed_at":"2026-08-02T15:02:59.139372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T00:14:47.682360Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.04034","last_updated":"2026-08-03T02:28:52Z","snapshot_observed_at":"2026-08-08T13:10:44.856437Z","submitted_at":"2026-08-03T02:28:52Z","title":"A Multimodal Automatic Redteaming Evaluation based on Atomic Jailbreak Strategy Decoupling and Combination","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-08-07T00:14:47.682360Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2608.04034"},"observation_digest":"sha256:89ce5adfc0c33b60fa2d4cacfc6241d43486f2d487dcc444bfd2fcfd702c220f","observation_id":"d3a5ca68-e5e4-475a-9d0b-7ca49e3997bb","resolution":{"observed_at":"2026-08-07T00:14:47.682360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.05608/citation-record","integrity":"/paper/2311.05608/integrity","json":"/paper/2311.05608/citation-record.json","paper":"/paper/2311.05608"},"outbound":[],"paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","latest_version":3,"primary_category":"cs.CR","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2311.05608."}