{"as_of":"2026-08-10T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb5044cb9bd5fb9eb81264e9722a1ce36e4ff6ab25802d95e5dee3811387a446","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:22:03.315478Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T22:36:35.008744Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"cited_work":{"arxiv_id":"2505.21967","doi":"10.48550/arxiv.2505.21967","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2505.21967(2025).https://doi.org/ 10.48550/ARXIV.2505.21967,https://doi.org/10.48550/arXiv.2505.21967","venue":"ArXiv.org","work_id":"b32e6d94-ae80-4ef1-abec-f77ec8fcc507","year":2025},"citing_paper":{"arxiv_id":"2605.10764","last_updated":"2026-06-29T08:36:15Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T15:59:02Z","title":"Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T03:37:02.206788Z"},"links":{"cited_paper":"/paper/2505.21967","citing_paper":"/paper/2605.10764"},"observation_digest":"sha256:aea0aef5141e0344a73a79bac62af286d0e548b60ee8f8f0ad2f48ba856cbd8e","observation_id":"f60e2885-fcfa-4e92-965f-45e4e2c9b8e8","resolution":{"observed_at":"2026-05-12T03:51:21.142226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"cited_work":{"arxiv_id":"2505.21967","doi":"10.48550/arxiv.2505.21967","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21967","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoRRabs/2505.21967(2025).https://doi.org/ 10.48550/ARXIV.2505.21967,https://doi.org/10.48550/arXiv.2505.21967","venue":"ArXiv.org","work_id":"b32e6d94-ae80-4ef1-abec-f77ec8fcc507","year":2025},"citing_paper":{"arxiv_id":"2605.10764","last_updated":"2026-06-29T08:36:15Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T15:59:02Z","title":"Break the Brake, Not the Wheel: Untargeted Jailbreak via Entropy Maximization","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T22:36:35.008744Z"},"links":{"cited_paper":"/paper/2505.21967","citing_paper":"/paper/2605.10764"},"observation_digest":"sha256:b68b00aeba4728a01c194da8f269ca7045c14c481b3cfced73ef413ee82f7c8a","observation_id":"6f56305f-00ec-4234-8302-71e500584cca","resolution":{"observed_at":"2026-06-30T22:45:06.840605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21967/citation-record","integrity":"/paper/2505.21967/integrity","json":"/paper/2505.21967/citation-record.json","paper":"/paper/2505.21967"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:59.997430Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T13:21:59.997430Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:1d7babad0957f79cecf7f16e41974fefc61a4cb15b037bbd84e22a0c4f885663","observation_id":"d19d6d1c-9902-40bf-86c3-3486ab3c69af","resolution":{"observed_at":"2026-08-07T13:21:59.997430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:00.083452Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.083452Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:1af0c8a67b14b7883864e69ca5a08eabe7dbec0915c8c2a59be5f2e1225ee909","observation_id":"8d57f9d3-34a8-44a3-96a8-dd0bfd9aa116","resolution":{"observed_at":"2026-08-07T13:22:00.083452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.910059Z","title":null,"venue":null,"work_id":"811dceaf-4cc8-4134-b106-6b1ef9986c45","year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.188628Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:38a69ab91997561034eea7c3b83e5e826a0e85427aaae7dbc52ac80f791fdf98","observation_id":"4306a273-91d8-4e0f-bef0-f8bbdf768d8e","resolution":{"observed_at":"2026-08-07T13:22:04.973791Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T13:22:00.280789Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.280789Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:fc5d4e4df5b93cf56a341541f98e2cb592c41a958ede82866663226fa0199f94","observation_id":"eca866ee-afb6-4d8d-9af3-01bfed357942","resolution":{"observed_at":"2026-08-07T13:22:00.280789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15447","last_updated":"2024-05-06T06:36:24Z","snapshot_observed_at":"2026-08-03T21:29:11.660688Z","submitted_at":"2023-06-26T17:18:44Z","title":"Are aligned neural networks adversarially aligned?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15447","snapshot_observed_at":"2026-08-07T13:22:00.372780Z","title":"Choquette-Choo, Matthew Jagielski, Irena Gao, Anas Awadalla, Pang Wei Koh, Daphne Ippolito, Katherine Lee, Florian Tramer, and Ludwig Schmidt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.372780Z"},"links":{"cited_paper":"/paper/2306.15447","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ad1d37fd65e0bed9c2f053c0241e089fd5a6c67a9b42e47d8fdb4d46a68be0e1","observation_id":"553ad8f8-e473-4063-af66-0fd1741979ea","resolution":{"observed_at":"2026-08-07T13:22:00.372780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.763235Z","title":null,"venue":null,"work_id":"36353502-65a7-4d40-8433-0c1146efef11","year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.472931Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:44e43d32562b2a8a92d1936b703a654c3e761c3461712444a9df948dcf733600","observation_id":"08a26a18-0ea7-4d56-8163-881621a560ad","resolution":{"observed_at":"2026-08-07T13:22:04.826249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06625","last_updated":"2025-02-10T05:47:27Z","snapshot_observed_at":"2026-07-06T19:30:13.003609Z","submitted_at":"2024-10-09T07:21:43Z","title":"ETA: Evaluating Then Aligning Safety of Vision Language Models at Inference Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06625","snapshot_observed_at":"2026-08-07T13:22:00.577809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.577809Z"},"links":{"cited_paper":"/paper/2410.06625","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:fdf4479501c9998d822c1d62a9acc072ec0d37baf46737a1ff90cc5b929d4b4d","observation_id":"71c06227-c851-4b21-a88d-dc330c50fe68","resolution":{"observed_at":"2026-08-07T13:22:00.577809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2501.18533","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":null,"venue":"arXiv (Cornell University)","work_id":"1a90921c-0138-414c-87d9-570e89819d18","year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.668623Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:d1aff88d75cab3af8aa5ac5b4c3f3eec8dd3d29591e14f3e45ce9fa422a6120b","observation_id":"a75ab97f-f187-4f3f-9c6c-c72661c2fe55","resolution":{"observed_at":"2026-08-07T13:22:04.260322Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-07-06T16:45:24.070954Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-07T13:22:00.808067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.808067Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:dd42b0872ff78887d39454a2d8af5b94716e37f78cc308437e6e47583abbb6e4","observation_id":"154a0da8-bb06-4901-b630-d98a7539b344","resolution":{"observed_at":"2026-08-07T13:22:00.808067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09572","last_updated":"2024-10-15T04:55:36Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T17:03:04Z","title":"Eyes Closed, Safety On: Protecting Multimodal LLMs via Image-to-Text Transformation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09572","snapshot_observed_at":"2026-08-07T13:22:00.937985Z","title":"Kwok, and Yu Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:00.937985Z"},"links":{"cited_paper":"/paper/2403.09572","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:80d84fd8224873edfd9442c51d2840eff5ee87de042b7b497e52578a72ef8112","observation_id":"5610b33f-03d5-463d-a71f-065bddc96ba1","resolution":{"observed_at":"2026-08-07T13:22:00.937985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08410","last_updated":"2025-03-06T01:45:26Z","snapshot_observed_at":"2026-08-08T09:32:45.644834Z","submitted_at":"2024-11-13T07:57:19Z","title":"The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08410","snapshot_observed_at":"2026-08-07T13:22:01.083283Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.083283Z"},"links":{"cited_paper":"/paper/2411.08410","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:a4114f2ffca1c6e5792bfa842490589fc3081adc95ce93b0e5019f386ee9f828","observation_id":"6238b638-3e4c-4bf3-beb4-1af93b5b1163","resolution":{"observed_at":"2026-08-07T13:22:01.083283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06987","last_updated":"2023-10-10T20:15:54Z","snapshot_observed_at":"2026-07-06T16:30:46.321160Z","submitted_at":"2023-10-10T20:15:54Z","title":"Catastrophic Jailbreak of Open-source LLMs via Exploiting Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06987","snapshot_observed_at":"2026-08-07T13:22:01.209865Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.209865Z"},"links":{"cited_paper":"/paper/2310.06987","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:8f56dcdc26466f051e69adeaec7ca12693c58f597ee241d1ed3dde2f4fa2709a","observation_id":"5f2bf4b8-33ce-41c4-8b52-cbe9f76ad5f9","resolution":{"observed_at":"2026-08-07T13:22:01.209865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09792","last_updated":"2025-01-13T03:30:37Z","snapshot_observed_at":"2026-08-09T10:29:24.807847Z","submitted_at":"2024-03-14T18:24:55Z","title":"Images are Achilles' Heel of Alignment: Exploiting Visual Vulnerabilities for Jailbreaking Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09792","snapshot_observed_at":"2026-08-07T13:22:01.312248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.312248Z"},"links":{"cited_paper":"/paper/2403.09792","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:93310948f992c94b0c0bae30ea417f3a5239a904c4c9f92afe82381e81c71969","observation_id":"2a43af3d-bcb8-4cfb-9482-2b6cd603c2ae","resolution":{"observed_at":"2026-08-07T13:22:01.312248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:01.409051Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.409051Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:e5b2fb9971fdfe93ecdd034f008dbfb35974fa73597ea6e9660f1d360d09ff3c","observation_id":"191a6725-f006-4205-9b9b-2dbb1cddb02c","resolution":{"observed_at":"2026-08-07T13:22:01.409051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T13:22:01.498183Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.498183Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:e0ddbe9a75005299e9240c466d833e17066818b819933dd905f3bfb306f1027a","observation_id":"2b50626b-3742-48af-97b5-1c12fe9a4428","resolution":{"observed_at":"2026-08-07T13:22:01.498183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17600","last_updated":"2024-06-19T08:32:14Z","snapshot_observed_at":"2026-07-06T16:54:22.039181Z","submitted_at":"2023-11-29T12:49:45Z","title":"MM-SafetyBench: A Benchmark for Safety Evaluation of Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17600","snapshot_observed_at":"2026-08-07T13:22:01.628548Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.628548Z"},"links":{"cited_paper":"/paper/2311.17600","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:28238ca40da37605dd40a0f434d475ae192e4caeb266c38216c7fce2a7c7d72d","observation_id":"372b9fad-d7ae-415b-8e5c-2fa6374a698b","resolution":{"observed_at":"2026-08-07T13:22:01.628548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03027","last_updated":"2024-11-24T06:22:37Z","snapshot_observed_at":"2026-08-06T14:20:00.145899Z","submitted_at":"2024-04-03T19:23:18Z","title":"JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03027","snapshot_observed_at":"2026-08-07T13:22:01.713276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.713276Z"},"links":{"cited_paper":"/paper/2404.03027","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:652b400c675efe649bcec5ccfeb3b889b1416016723f72f919b56c9fa809c24c","observation_id":"14a7de28-2358-4d2e-a772-e43b6ba251de","resolution":{"observed_at":"2026-08-07T13:22:01.713276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20773","last_updated":"2024-06-12T07:13:48Z","snapshot_observed_at":"2026-08-08T10:04:07.258178Z","submitted_at":"2024-05-25T17:17:18Z","title":"Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20773","snapshot_observed_at":"2026-08-07T13:22:01.801888Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.801888Z"},"links":{"cited_paper":"/paper/2405.20773","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:db92315e32710bfe8ca76be8329f6527df0545976684405b81715e4476cbc148","observation_id":"175db9d6-728f-4140-a7eb-cb7830d3e6b1","resolution":{"observed_at":"2026-08-07T13:22:01.801888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.587144Z","title":null,"venue":null,"work_id":"35b73cd8-c8da-4d0a-bbca-030038174e40","year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.862758Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:5a7ab179f4093d4704180a3197d328d74b2f48772a1274e2d1dccfce25151a7d","observation_id":"bc0c3f8e-dab5-4a54-a16f-4c8b6da1a3c5","resolution":{"observed_at":"2026-08-07T13:22:04.658281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:22:04.457016Z","title":null,"venue":null,"work_id":"74668426-196c-4631-9e48-c3b918ab6b96","year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:01.979525Z"},"links":{"citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:7033828f684f78d4447abb0a8b8af39da88fc49e0485ff3e2aca29d6e8a5ec76","observation_id":"7e7c3462-64c6-4026-a5e5-68bae8996c5f","resolution":{"observed_at":"2026-08-07T13:22:04.512101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-07T13:22:02.114092Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.114092Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:2df201ee4b3916bde2f87ea6c050b0a6417a789b0d6fc663fe3b12969d12a930","observation_id":"1ec2665d-f663-457b-b69e-de22614a81c1","resolution":{"observed_at":"2026-08-07T13:22:02.114092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-09T21:14:39.812982Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-07T13:22:02.206932Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.206932Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:eface58a77098f56c88e7cb1c1140d709438a8ba999d8c769c2974f3ef7ef223","observation_id":"b8bad99f-9b0a-4851-beef-152ef6c85924","resolution":{"observed_at":"2026-08-07T13:22:02.206932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03693","last_updated":"2023-10-05T17:12:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-05T17:12:17Z","title":"Fine-tuning Aligned Language Models Compromises Safety, Even When Users Do Not Intend To!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03693","snapshot_observed_at":"2026-08-07T13:22:02.264836Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.264836Z"},"links":{"cited_paper":"/paper/2310.03693","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:67647693c37b9c3582bdef4dbd4b5168a2d245fa218a1e5be8deb8626dfd87fb","observation_id":"c8c52f74-861c-4210-8aff-3a9380812a78","resolution":{"observed_at":"2026-08-07T13:22:02.264836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-07T13:22:02.361804Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.361804Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:5ad2ca4261934c7790bdb4b2724aa46378bbd28a5a1ba472b1a7abdba528cb51","observation_id":"6c78856d-3fd0-4a59-9047-c400e615f3c3","resolution":{"observed_at":"2026-08-07T13:22:02.361804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T13:22:02.468108Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.468108Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:fd3b12709a2dea0fb42a85bcc579185b254249053f3be22e2417f4147e11baea","observation_id":"6dcc71f0-4f11-464c-91e1-7b1e3cfb7638","resolution":{"observed_at":"2026-08-07T13:22:02.468108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14539","last_updated":"2023-10-10T22:17:17Z","snapshot_observed_at":"2026-07-06T15:59:03.095461Z","submitted_at":"2023-07-26T23:11:15Z","title":"Jailbreak in pieces: Compositional Adversarial Attacks on Multi-Modal Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14539","snapshot_observed_at":"2026-08-07T13:22:02.564374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.564374Z"},"links":{"cited_paper":"/paper/2307.14539","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ed77d0ed6602feb14f086404dcd9c1613d54dcc2276ff1b3e22e12b71cfb40f1","observation_id":"640678cd-a03e-41a8-b33a-01dfcf983ed4","resolution":{"observed_at":"2026-08-07T13:22:02.564374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-07T13:22:02.650913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.650913Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:4ba218c40c9874925d1a789320a468dad76bd69268b550b79e0a6b90c3a927bd","observation_id":"2695b31c-6fb7-47be-871f-bf585facd308","resolution":{"observed_at":"2026-08-07T13:22:02.650913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15279","last_updated":"2025-02-17T03:38:42Z","snapshot_observed_at":"2026-08-10T16:09:29.865041Z","submitted_at":"2024-06-21T16:14:15Z","title":"Safe Inputs but Unsafe Output: Benchmarking Cross-modality Safety Alignment of Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15279","snapshot_observed_at":"2026-08-07T13:22:02.762002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.762002Z"},"links":{"cited_paper":"/paper/2406.15279","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:cf19e682a10b39cc63765749aae026de81327f1fff1cd031a2468a616c9d77e5","observation_id":"d9418b88-1f0e-4957-9ca1-fd398b28f113","resolution":{"observed_at":"2026-08-07T13:22:02.762002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09513","last_updated":"2024-03-14T15:57:13Z","snapshot_observed_at":"2026-08-10T16:53:36.407956Z","submitted_at":"2024-03-14T15:57:13Z","title":"AdaShield: Safeguarding Multimodal Large Language Models from Structure-based Attack via Adaptive Shield Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09513","snapshot_observed_at":"2026-08-07T13:22:02.837913Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.837913Z"},"links":{"cited_paper":"/paper/2403.09513","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:456bbe29b0bc98b30668a46c83e72f1f39e8a264d3db69b836cdfdedd42496be","observation_id":"7c17b61d-0b4d-4798-9adc-1d39b89c96a8","resolution":{"observed_at":"2026-08-07T13:22:02.837913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08464","last_updated":"2024-10-22T02:01:16Z","snapshot_observed_at":"2026-08-10T02:32:33.674748Z","submitted_at":"2024-08-16T00:18:23Z","title":"$\\textit{MMJ-Bench}$: A Comprehensive Study on Jailbreak Attacks and Defenses for Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08464","snapshot_observed_at":"2026-08-07T13:22:02.930271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.930271Z"},"links":{"cited_paper":"/paper/2408.08464","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:32ba5677b71ca23701da3a30b906e4989fc10c29131a1bdca7c54f7ab7470f57","observation_id":"a689702f-811f-42a2-956b-4bcb5dd45768","resolution":{"observed_at":"2026-08-07T13:22:02.930271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12030","last_updated":"2025-05-21T04:55:10Z","snapshot_observed_at":"2026-08-10T16:09:01.407274Z","submitted_at":"2024-06-17T18:57:37Z","title":"SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12030","snapshot_observed_at":"2026-08-07T13:22:02.983754Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:02.983754Z"},"links":{"cited_paper":"/paper/2406.12030","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:ccc32ad376a65cbbbe818fb78cdb7eb525245ae442bcedff54d6dfbfc6953da3","observation_id":"66eaf8e9-4a0e-441f-bf8c-28a6b5c608d6","resolution":{"observed_at":"2026-08-07T13:22:02.983754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20971","last_updated":"2025-02-12T05:52:11Z","snapshot_observed_at":"2026-08-10T17:17:03.361497Z","submitted_at":"2024-10-28T12:43:47Z","title":"BlueSuffix: Reinforced Blue Teaming for Vision-Language Models Against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20971","snapshot_observed_at":"2026-08-07T13:22:03.045502Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.045502Z"},"links":{"cited_paper":"/paper/2410.20971","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:26db47237169e54d10fd81919234fcda01dc9d3abfde80cd4fdae2bdba911414","observation_id":"704c3b50-ed54-4bfa-821b-53c6d7106ce8","resolution":{"observed_at":"2026-08-07T13:22:03.045502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06172","last_updated":"2025-04-22T23:01:49Z","snapshot_observed_at":"2026-08-10T16:08:58.489045Z","submitted_at":"2024-10-08T16:16:07Z","title":"Multimodal Situational Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06172","snapshot_observed_at":"2026-08-07T13:22:03.133709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.133709Z"},"links":{"cited_paper":"/paper/2410.06172","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:5ce204034527c1778d9dc8ffd1857a0da50787d0ef2539f438a995be1e6c4371","observation_id":"7ca0153f-f489-4660-824d-dca44f119fae","resolution":{"observed_at":"2026-08-07T13:22:03.133709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02207","last_updated":"2024-06-17T22:26:32Z","snapshot_observed_at":"2026-08-09T09:35:21.862266Z","submitted_at":"2024-02-03T16:43:42Z","title":"Safety Fine-Tuning at (Almost) No Cost: A Baseline for Vision Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02207","snapshot_observed_at":"2026-08-07T13:22:03.217330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.217330Z"},"links":{"cited_paper":"/paper/2402.02207","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:b35833801538b314389a5f7f37a79c4d6ddeadb1823df734d71831936ec70bbd","observation_id":"d7030a2a-6b04-40d9-aa36-666ba7ecdcdf","resolution":{"observed_at":"2026-08-07T13:22:03.217330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02534","last_updated":"2024-08-26T22:56:28Z","snapshot_observed_at":"2026-07-06T18:40:31.586903Z","submitted_at":"2024-07-01T16:58:55Z","title":"Image-to-Text Logic Jailbreak: Your Imagination can Help You Do Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02534","snapshot_observed_at":"2026-08-07T13:22:03.315478Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T13:22:03.315478Z"},"links":{"cited_paper":"/paper/2407.02534","citing_paper":"/paper/2505.21967"},"observation_digest":"sha256:fc7d3e0dc00a9d6560358c00c901183954649f1786dca7c7a66cf4748d3a8dde","observation_id":"223155c9-a9f7-4614-b43b-90df379ffc4a","resolution":{"observed_at":"2026-08-07T13:22:03.315478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21967","last_updated":"2025-05-28T04:43:39Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T01:18:33.252536Z","submitted_at":"2025-05-28T04:43:39Z","title":"Seeing the Threat: Vulnerabilities in Vision-Language Models to Adversarial Attack"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2505.21967."}