{"as_of":"2026-08-23T05:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7e8768f16be3da9e4aca2165dcf5fd73e8b56d05a66fe42c951632022d4ece52","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:04:45.533578Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:34:34.429357Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-16T04:34:34.547389Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"cited_work":{"arxiv_id":"2411.15720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15720","snapshot_observed_at":"2026-08-16T04:34:34.547389Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","venue":"cs.CV","work_id":"c93348b0-2e25-4c99-abdc-852f28035124","year":2024},"citing_paper":{"arxiv_id":"2505.01050","last_updated":"2025-05-02T06:51:11Z","snapshot_observed_at":"2026-08-19T15:15:20.401413Z","submitted_at":"2025-05-02T06:51:11Z","title":"Transferable Adversarial Attacks on Black-Box Vision-Language Models","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-16T04:34:34.429357Z"},"links":{"cited_paper":"/paper/2411.15720","citing_paper":"/paper/2505.01050"},"observation_digest":"sha256:c2689e1d065bb3457999ec979c05637aab31442e3c2c74b92b3d99b049c144bf","observation_id":"8098073a-5b68-454e-a740-3086ae4f2dad","resolution":{"observed_at":"2026-08-16T04:34:34.553216Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15720/citation-record","integrity":"/paper/2411.15720/integrity","json":"/paper/2411.15720/citation-record.json","paper":"/paper/2411.15720"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:04:45.265930Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.265930Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:cc111159006a42d534cca79649c9ff8cbb98ee41fb4d4e547b9bd902b7c8a0b8","observation_id":"9465c12d-16e0-42fd-9df6-635c937d8f8d","resolution":{"observed_at":"2026-08-12T14:04:45.265930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.271659Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.271659Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:e6084cdb65a3cd44c2b4f95617e06d8c1ddd0c81d77fb214010cad81197b0988","observation_id":"278eacc9-6bb0-4c15-91c4-0d24191c39dc","resolution":{"observed_at":"2026-08-12T14:04:45.271659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00236","last_updated":"2024-09-17T19:56:09Z","snapshot_observed_at":"2026-08-19T01:23:57.750375Z","submitted_at":"2023-09-01T03:53:40Z","title":"Image Hijacks: Adversarial Images can Control Generative Models at Runtime","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00236","snapshot_observed_at":"2026-08-12T14:04:45.276730Z","title":"Image hijacks: Adversarial images can control generative models at runtime","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.276730Z"},"links":{"cited_paper":"/paper/2309.00236","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:e463f14a707948474d383e784d6ad403d51988dc6c7349621f2a9e3eedd1e0b7","observation_id":"724168eb-2f27-4764-901e-b5c6e2853967","resolution":{"observed_at":"2026-08-12T14:04:45.276730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.505305Z","title":"One transformer fits all distributions in multi-modal diffu- sion at scale","venue":null,"work_id":"0b4e362c-5454-426b-a43a-e268b8193c97","year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.281986Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:0d838aae3fdf45f73312d6baa38703c85dfb62046061bc6d5e4ba89e54076fa9","observation_id":"0f3c50c8-331c-400d-bcb1-1a28d6f2a09e","resolution":{"observed_at":"2026-08-12T14:04:46.510234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-12T14:04:45.286960Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.286960Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:3713e802dba0b84453889bc9ac25824364434cb57fc7aabaced004b10b17bb96","observation_id":"dca4f61e-f790-474d-bd4b-140f50cfccbc","resolution":{"observed_at":"2026-08-12T14:04:45.286960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06705","last_updated":"2019-02-20T17:38:32Z","snapshot_observed_at":"2026-08-14T17:14:47.799958Z","submitted_at":"2019-02-18T18:18:27Z","title":"On Evaluating Adversarial Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06705","snapshot_observed_at":"2026-08-12T14:04:45.291956Z","title":"On evaluating adversarial robustness","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.291956Z"},"links":{"cited_paper":"/paper/1902.06705","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:fa2739ae143593431c09a9378c589ea905b11140b6408e4e55fc965a5f2f279e","observation_id":"2a3d54cd-5d13-4f8c-9179-1262e0056135","resolution":{"observed_at":"2026-08-12T14:04:45.291956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.490065Z","title":"Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"c864ee18-efab-43b9-bf31-d06d3a70d334","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.297408Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:03bb6c99e3d8b8dd0fe462016981c62b0de7e66682ef2c2a38399b4ff3de9bcc","observation_id":"ac2367b1-b2ed-4d99-a166-27d6df747aaf","resolution":{"observed_at":"2026-08-12T14:04:46.494925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.02051","last_updated":"2018-05-22T01:56:51Z","snapshot_observed_at":"2026-08-14T20:06:26.136766Z","submitted_at":"2017-12-06T06:08:59Z","title":"Attacking Visual Language Grounding with Adversarial Examples: A Case Study on Neural Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.02051","snapshot_observed_at":"2026-08-12T14:04:45.302110Z","title":"Attacking visual language grounding with adversarial examples: A case study on neural image caption- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.302110Z"},"links":{"cited_paper":"/paper/1712.02051","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:ea6b72eedb3c66a1f060a2d14327c275322f0dca9c9f8de0ed053f53bb5875a3","observation_id":"def00373-d365-4270-8781-2a5121f04642","resolution":{"observed_at":"2026-08-12T14:04:45.302110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09105","last_updated":"2024-03-04T11:30:06Z","snapshot_observed_at":"2026-08-19T12:47:37.176074Z","submitted_at":"2023-03-16T06:37:16Z","title":"Rethinking Model Ensemble in Transfer-based Adversarial Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09105","snapshot_observed_at":"2026-08-12T14:04:45.307991Z","title":"Rethinking model ensem- ble in transfer-based adversarial attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.307991Z"},"links":{"cited_paper":"/paper/2303.09105","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:0b245867bb435e3e0465e9d9ad60c998fe9972d9725eda252caaaed0e3227c8a","observation_id":"ef3077b2-2aa8-405b-a459-109a278f3a35","resolution":{"observed_at":"2026-08-12T14:04:45.307991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.474928Z","title":"Visualgpt: Data-efficient adaptation of pretrained language models for image captioning","venue":null,"work_id":"e82b7ef5-432b-43bd-92a6-02fa6c8a26d1","year":2022},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.313248Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:de6950ec88d005fc7e35fd2d4180bec97497ca6b53092133330c5f4a8a859a23","observation_id":"d5b04198-9e4d-49f2-a807-185ac811989b","resolution":{"observed_at":"2026-08-12T14:04:46.479746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-20T14:30:51.079652Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T14:04:45.317956Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.317956Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:d697860b00050abbf25ed58de1a60e25375b2f525fba90384c414bc6215911e3","observation_id":"1a00a7c4-09f5-4230-afbd-962ed25caae8","resolution":{"observed_at":"2026-08-12T14:04:45.317956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.322630Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.322630Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:a9580b9fb565257063d6243bf8c9685e0354fcd887d8b7d2279d45c5cd7ea901","observation_id":"2c4dbad5-255b-498f-b98e-6f7ea2be4121","resolution":{"observed_at":"2026-08-12T14:04:45.322630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.448888Z","title":"On the robustness of large multimodal mod- els against image adversarial attacks","venue":null,"work_id":"fc0e15e7-9b9b-45b3-8edd-290f061ce69a","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.327198Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:23619a9c17704bd43f04d18ebd023ee09c7554325c9aea15309ad054385e1048","observation_id":"cb4aeab9-d8a7-4d16-8e41-98e7d221a17e","resolution":{"observed_at":"2026-08-12T14:04:46.453752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.431846Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"38ba960e-1539-409d-809b-2143b3d96919","year":2009},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.331657Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:da751154f351c48e6ee898b204512f62218b51f65eda3a5e57f4b6404dd66f76","observation_id":"b4684860-9ea8-47c9-85af-bd2b360debb7","resolution":{"observed_at":"2026-08-12T14:04:46.437420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.416618Z","title":"Boosting adversarial at- tacks with momentum","venue":null,"work_id":"f3be1d5e-c7ef-42d3-9c8b-d4d6632b28d9","year":2018},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.336219Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:6ef0bf6598f4374c09229005043b57581592b8120eeeca89fd342259fc96fd02","observation_id":"5722d0ba-873b-4a86-9fed-4a897f2f0db7","resolution":{"observed_at":"2026-08-12T14:04:46.421440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.400610Z","title":"Query-efficient black-box adversarial attacks guided by a transfer-based prior","venue":null,"work_id":"ce2efef5-fd17-42ab-bdc9-d3c72ba511ae","year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.340730Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:edc6c96162312436a468ad7ad518a4690dddf8daba438a888e461a8f0dff065d","observation_id":"eff8c265-d324-4f9f-888e-83c2eb789aab","resolution":{"observed_at":"2026-08-12T14:04:46.406233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11751","last_updated":"2023-10-14T12:56:13Z","snapshot_observed_at":"2026-08-16T14:58:55.951885Z","submitted_at":"2023-09-21T03:24:30Z","title":"How Robust is Google's Bard to Adversarial Image Attacks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11751","snapshot_observed_at":"2026-08-12T14:04:45.345445Z","title":"How robust is google’s bard to adversarial image at- tacks? arXiv preprint arXiv:2309.11751, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.345445Z"},"links":{"cited_paper":"/paper/2309.11751","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:9eac5c6734f5a367ace201dbe841f15d716fc0fd8e6ad5bef2de8e8812156716","observation_id":"b305d782-bd03-4cc6-9574-69ebd0f8cdd0","resolution":{"observed_at":"2026-08-12T14:04:45.345445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:04:45.350159Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.350159Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:19179dc1e1f919a4fcd4f97d07148691f5d10ebe53870159a10e982d9748a50b","observation_id":"2527124c-5dab-42b9-ba28-354b1739f51a","resolution":{"observed_at":"2026-08-12T14:04:45.350159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.384896Z","title":"Transferable decoding with visual entities for zero-shot image captioning","venue":null,"work_id":"c82b147b-fced-4f63-ab06-2f6f50a8c757","year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.354889Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:a719a5b2a0be0e4735df24eb7d13e76f13af6c5da50bbce81674aefc7231e3ab","observation_id":"0dc6c3e0-3019-4a23-9054-092bfa50da79","resolution":{"observed_at":"2026-08-12T14:04:46.389920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03185","last_updated":"2023-10-04T22:10:01Z","snapshot_observed_at":"2026-08-19T16:37:39.483476Z","submitted_at":"2023-10-04T22:10:01Z","title":"Misusing Tools in Large Language Models With Visual Adversarial Examples","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03185","snapshot_observed_at":"2026-08-12T14:04:45.359652Z","title":"Misusing tools in large language mod- els with visual adversarial examples","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.359652Z"},"links":{"cited_paper":"/paper/2310.03185","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:320713cc4f2d71045c355e87b1edc7071050509c37f92a7409093190590a70fd","observation_id":"d99fc87f-5a8e-416b-bb9a-3951d919900d","resolution":{"observed_at":"2026-08-12T14:04:45.359652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-18T12:18:02.474208Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-12T14:04:45.364618Z","title":"Figstep: Jailbreaking large vision-language models via typo- graphic visual prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.364618Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:7b6d8b052e5646f149659c450e0de67b371e2a6894334e4748db22494be5ff5e","observation_id":"455e54ab-a27b-4814-8c6b-0ccdb3868698","resolution":{"observed_at":"2026-08-12T14:04:45.364618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-19T07:17:20.004918Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-12T14:04:45.369843Z","title":"Explaining and harnessing adversarial ex- amples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.369843Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:549669d42c282db2dc1d20ca8a138057d70a054481acd27c0b86336273954471","observation_id":"eb0c1066-5b28-4eb1-98e9-a7599193977c","resolution":{"observed_at":"2026-08-12T14:04:45.369843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.368969Z","title":"Simple black-box adversar- ial attacks","venue":null,"work_id":"18930f62-9e37-4b9d-ad40-6f7d2d8e779c","year":2019},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.374370Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:638e8d3a082bcdee293c3cd578a5d715116b14fa03b0410ae98e16fb9b058f9c","observation_id":"23b15a9f-03a8-420a-9193-10ce65785e56","resolution":{"observed_at":"2026-08-12T14:04:46.373846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.378882Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.378882Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:b6c289c339711b993a8618d0b11de452b18d81cdf83c68d549046a4180155439","observation_id":"d9f44e4a-fcfb-46a5-837f-3629ed15c53c","resolution":{"observed_at":"2026-08-12T14:04:45.378882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.342762Z","title":"Enhancing adversarial example transferability with an intermediate level attack","venue":null,"work_id":"accb6f78-157b-4332-a986-1df2f5340d52","year":2019},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.383684Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:1c6f5662fa234c70fd706d2465697bebf5a9721939f0c86ab73c856d1b2733ee","observation_id":"260eec44-4f03-47d9-829d-eff3209d306b","resolution":{"observed_at":"2026-08-12T14:04:46.347680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.326907Z","title":"Black-box adversarial attacks with limited queries and information","venue":null,"work_id":"feb77d3b-3783-41ee-9007-184770a854f1","year":2018},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.388510Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:9971fe470ebe435a3772bb2a76f5f2a35cb72af5e92f1a39750a16ddf47c7f6f","observation_id":"0e744330-1374-4afe-b196-5bcdd9791f62","resolution":{"observed_at":"2026-08-12T14:04:46.331922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.394023Z","title":"Jailbreakzoo: Survey, landscapes, and horizons in jailbreaking large language and vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.394023Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:8666c9c5e2e2ed0db94c0122e76e756c31b9924596be0dd64d29e5ebcd08c73f","observation_id":"57ac0a62-e22f-4c7b-ae8f-71f2b98b55be","resolution":{"observed_at":"2026-08-12T14:04:45.394023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.399083Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.399083Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:6c32f14e0e69d2015f81d99941d4a079cf8dd7eed62f62a46fd320fd8036fe1e","observation_id":"6eb0efc9-d3b0-458d-b9e8-be1d4452e1ff","resolution":{"observed_at":"2026-08-12T14:04:45.399083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.301524Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"0ba749f0-a9c9-46e5-95a0-f9846c8aea0d","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.403338Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:4407772ce67873fb2873b182acea98d4239d7a565a2c620bdd6afcb3dbb70e89","observation_id":"8809e5a4-2b83-48e4-81de-90f8229468ee","resolution":{"observed_at":"2026-08-12T14:04:46.306412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.286008Z","title":"Visual instruction tuning","venue":null,"work_id":"89fa3851-09bb-49c6-94c8-02da34917bfc","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.407508Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:171f9e1d9dce2ed5467327d9698490512aa29f72841a1ecf010337b975d559fd","observation_id":"ae9cf933-1803-4760-a0d3-924c70bc902d","resolution":{"observed_at":"2026-08-12T14:04:46.291322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02770","last_updated":"2017-02-07T14:24:44Z","snapshot_observed_at":"2026-08-18T17:48:45.518915Z","submitted_at":"2016-11-08T23:25:00Z","title":"Delving into Transferable Adversarial Examples and Black-box Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02770","snapshot_observed_at":"2026-08-12T14:04:45.412014Z","title":"Delving into transferable adversarial examples and black- box attacks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.412014Z"},"links":{"cited_paper":"/paper/1611.02770","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:8dc9a7db08e55c967a044cd23d7153700725419811e9d793e0ff21cd2f384143","observation_id":"f529ce5c-d849-4d9c-8f6b-8ede1a60fba4","resolution":{"observed_at":"2026-08-12T14:04:45.412014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.270274Z","title":"Delving into transferable adversarial examples and black- box attacks","venue":null,"work_id":"e0f5cb1c-5435-49e8-bbf0-9375d2bef212","year":2017},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.416609Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:227989cdb683358b55647c736944907a9ab739352583f8af80222214f3469418","observation_id":"11626c42-057c-481f-8623-7e7c4cb46010","resolution":{"observed_at":"2026-08-12T14:04:46.275318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-12T14:04:45.421221Z","title":"Towards deep learning models resis- tant to adversarial attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.421221Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:72e9c2d6eb73bf2f88ae9ab5ef87732335521c05d21102581f66eedff8f14735","observation_id":"c9a7b32e-17ad-4556-a584-f33a14cf35f0","resolution":{"observed_at":"2026-08-12T14:04:45.421221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-12T14:04:45.425894Z","title":"Clip- cap: Clip prefix for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.425894Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:a65972dc19282ea1ee50f527829ea21bf7448dc5c0be7df54fb865b9beb2c2a1","observation_id":"db831ca2-61dd-425b-977f-52846b6be8fe","resolution":{"observed_at":"2026-08-12T14:04:45.425894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.430441Z","title":"Deep neural networks are easily fooled: High confidence predictions for unrecognizable images","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.430441Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:b1f3257122f2b6bd3a485503842a478a9456efaf23528c70d5ff04dd42c1d157","observation_id":"3a583908-46da-47a4-8df0-be3535eab082","resolution":{"observed_at":"2026-08-12T14:04:45.430441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.244886Z","title":"Practi- cal black-box attacks against machine learning","venue":null,"work_id":"33f67f96-f3d5-4038-9780-d5a236e615ba","year":2017},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.434999Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:c48d83bae5731dd395de6cc6ad1be6c5d66ce67aeab95c5fe2148fce03aa077e","observation_id":"aabf837b-6f64-4191-ae19-f3ce9c8c758c","resolution":{"observed_at":"2026-08-12T14:04:46.249927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-12T14:04:45.439661Z","title":"Red teaming language models with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.439661Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:90f868c7fb8a2e5ac8c3c68aa728a975fcfdd4565b45747a73a754694b82ac27","observation_id":"68c7a997-5a37-4ed7-a343-df167c9bab1b","resolution":{"observed_at":"2026-08-12T14:04:45.439661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-16T15:21:48.065276Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-12T14:04:45.445238Z","title":"Visual adversarial exam- ples jailbreak large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.445238Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:0ac103fc70e3fba6bad3788e6579a0a3dc25d170209fcac2dca2b41065b20c93","observation_id":"131bc890-ff1a-4462-9df5-d54cb3533721","resolution":{"observed_at":"2026-08-12T14:04:45.445238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.229364Z","title":"Boosting the transferability of ad- versarial attacks with reverse adversarial perturbation","venue":null,"work_id":"1170440e-fac3-4d2d-a644-301b025f8c11","year":2022},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.450171Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:ed5a599ac1f58fd4c33c292e44113fac6c91f5739f76ab45926e5f8fd6549d5a","observation_id":"0dffcf7f-c20d-452f-b7cc-3a0407f56fdb","resolution":{"observed_at":"2026-08-12T14:04:46.234182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.454674Z","title":"Language models are unsu- pervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.454674Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:c182442fa75ff2544018784d2ee4101a10f4d4d57387f88c4743d76f22b7929a","observation_id":"ee143442-8368-488e-ab7b-81699295b20b","resolution":{"observed_at":"2026-08-12T14:04:45.454674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.203107Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"67cc39bc-65dc-403e-9def-25ef9adc5565","year":2021},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.459263Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:fbc1fffcdec4963f360f15b45a709bee346548307f6de59f64463fd8e879db59","observation_id":"f4571ce6-ad84-41da-8b59-415926b0dbf1","resolution":{"observed_at":"2026-08-12T14:04:46.208805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.186061Z","title":"Smallcap: lightweight image captioning prompted with retrieval augmentation","venue":null,"work_id":"2a1a214c-0e4d-416e-9cd3-117ec19995cd","year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.463657Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:acd9afaed9f682c87424c5c2a85ba84b46ea15642b3839b86cd49277fcb3f027","observation_id":"32d7222d-9524-403b-897f-02f3b6ae6d1e","resolution":{"observed_at":"2026-08-12T14:04:46.191362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04610","last_updated":"2022-11-10T10:07:37Z","snapshot_observed_at":"2026-08-19T14:14:31.764537Z","submitted_at":"2022-10-03T14:04:46Z","title":"Red-Teaming the Stable Diffusion Safety Filter","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04610","snapshot_observed_at":"2026-08-12T14:04:45.468299Z","title":"Red-teaming the stable diffusion safety filter","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.468299Z"},"links":{"cited_paper":"/paper/2210.04610","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:1555e24e81af3acfb422e858999ed8bc9b7c61c5ed87123e099cc61e796393ac","observation_id":"e6be4645-f99b-4a08-a473-f920a359b44b","resolution":{"observed_at":"2026-08-12T14:04:45.468299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.170153Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"113abf47-29c4-43f1-904f-8ad83d24122c","year":2022},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.472955Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:1a39cba0c412a64113418e3f18b6bf5332add56124de726b7ec4318ec973abe5","observation_id":"04091d0e-6ac4-47c8-a029-93a8bad3915a","resolution":{"observed_at":"2026-08-12T14:04:46.175234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T14:04:45.477320Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.477320Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:3e77ee676622a52026f4ef3f819463e6d52b4bc36c4a3527583040918a265b2d","observation_id":"e7ef2b3d-079c-4fc7-afe2-6f4c17489b54","resolution":{"observed_at":"2026-08-12T14:04:45.477320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T14:04:45.482107Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.482107Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:850f58fcb486b7da134cfe5554ead8808c1d9d190c1704689421af304638c28c","observation_id":"819d6954-93ba-49d1-a469-f2e347f8677b","resolution":{"observed_at":"2026-08-12T14:04:45.482107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.154462Z","title":"How many unicorns are in this image a safety evaluation benchmark for vision llms","venue":null,"work_id":"a052cbf5-d7ff-4d01-bf04-1f3874d83105","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.486582Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:0074ee049bae3b7a73bd74ad741090b029e150e9b922b8b30f8d3615707a0496","observation_id":"fac32d46-9ac9-47b8-86bf-1126fdaf3be9","resolution":{"observed_at":"2026-08-12T14:04:46.159394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.138289Z","title":"Decodingtrust: A com- prehensive assessment of trustworthiness in gpt models","venue":null,"work_id":"15cf9d98-f273-4595-bc49-aa5f0d94d716","year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.490762Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:7bfa02779001832cdaff92ceb2f4ac002880ac13d343083d82bb3879cd37191e","observation_id":"87f9dc7d-f8f0-4b69-aecc-f2dd709e3b53","resolution":{"observed_at":"2026-08-12T14:04:46.143484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.122300Z","title":"Exact adversarial attack to image captioning via structured output learning with la- tent variables","venue":null,"work_id":"02b12460-4d52-42d2-add0-c315af58cb00","year":2019},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.495218Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:cef3de95f60403c8ce8bbbf3c2813d7b9b27b9a53e933166f413813c6bbc694a","observation_id":"73c3d2fd-7404-4b75-aaf8-ce54a53d3172","resolution":{"observed_at":"2026-08-12T14:04:46.127179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23687","last_updated":"2025-05-17T03:16:08Z","snapshot_observed_at":"2026-08-20T05:54:48.328676Z","submitted_at":"2024-10-31T07:22:51Z","title":"Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey","version":2},"cited_work":{"arxiv_id":"2410.23687","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23687","snapshot_observed_at":"2026-08-12T14:04:45.632058Z","title":"Adversarial Attacks of Vision Tasks in the Past 10 Years: A Survey","venue":"cs.CV","work_id":"67554233-9a31-4e4b-a41b-668094d945d8","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.499682Z"},"links":{"cited_paper":"/paper/2410.23687","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:601c523e1a2d46cf86142d87b8dc7e925a3c694851d8bf62c559c09284361c02","observation_id":"9fc0d42a-727c-4fea-b7c7-6fcd83068a03","resolution":{"observed_at":"2026-08-12T14:04:45.637508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:45.504498Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.504498Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:7d50a20335039658103ec6a9c5069d6cb913bcf79e5142911b6c8ec4af3fa1ae","observation_id":"e242e9b5-987b-4cbf-9a31-9a194fc82351","resolution":{"observed_at":"2026-08-12T14:04:45.504498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07673","last_updated":"2023-08-15T09:43:10Z","snapshot_observed_at":"2026-08-16T15:08:24.811667Z","submitted_at":"2023-08-15T09:43:10Z","title":"A Review of Adversarial Attacks in Computer Vision","version":1},"cited_work":{"arxiv_id":"2308.07673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07673","snapshot_observed_at":"2026-08-12T14:04:45.607470Z","title":"A Review of Adversarial Attacks in Computer Vision","venue":"cs.CV","work_id":"370c3a5f-79f4-4b6e-b2d3-7974e17805de","year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.509333Z"},"links":{"cited_paper":"/paper/2308.07673","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:0047c69bddc8bee5ce39ce3e5eb6d9f9202487342161d6aa7d43ab0a5f9c4724","observation_id":"5bd67aec-a927-4b0a-b458-4f204a7d0253","resolution":{"observed_at":"2026-08-12T14:04:45.614774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10137","last_updated":"2023-10-15T10:04:38Z","snapshot_observed_at":"2026-08-19T22:40:33.310150Z","submitted_at":"2023-03-17T17:25:10Z","title":"A Recipe for Watermarking Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10137","snapshot_observed_at":"2026-08-12T14:04:45.513954Z","title":"A recipe for watermarking dif- fusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.513954Z"},"links":{"cited_paper":"/paper/2303.10137","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:a7c9e0bc95d268d6e29f640deddaa3457980c95a6f0399a8293a0efafa0bae9b","observation_id":"f62fb484-f36f-4296-a72d-05ee7d4f33ed","resolution":{"observed_at":"2026-08-12T14:04:45.513954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.096260Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"cc323c93-88d5-428c-9c79-48552994db8f","year":2024},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.519480Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:9cc7b3b9e7cd6f3af32950dc97323b66ec204daae6aef5e6eadc5c724815f426","observation_id":"44e1525b-a63d-4526-afd9-50c78ff60cc9","resolution":{"observed_at":"2026-08-12T14:04:46.101716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.079910Z","title":"Transferable ad- versarial perturbations","venue":null,"work_id":"58c07361-357f-411b-9857-7fa917b401a0","year":2018},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.524051Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:5b9db925a83955462bf994dc396092bbccc79bef2b6c1bbeb3657c404fcfa499","observation_id":"8447102d-4c56-4706-9e50-36519ca91265","resolution":{"observed_at":"2026-08-12T14:04:46.084878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T14:04:45.528550Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.528550Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:1e83250c33536e2af015edc609e9cf0a410109faacbf92f11f74266e242483ac","observation_id":"cf23132f-9ad5-4d51-9356-af7bce5250f5","resolution":{"observed_at":"2026-08-12T14:04:45.528550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:04:46.063598Z","title":"How do you think of this image?","venue":null,"work_id":"cfd23ce9-3714-4d04-be1f-d2ff8b2858fd","year":null},"citing_paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:04:45.533578Z"},"links":{"citing_paper":"/paper/2411.15720"},"observation_digest":"sha256:debe0736d5daaff015e366e6bb8d4b40d3b26970eadd37fb3c45d2ac7c95462c","observation_id":"deaa29fd-bdcf-41e4-bd4a-0cbfb48337c2","resolution":{"observed_at":"2026-08-12T14:04:46.068676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.15720","last_updated":"2024-11-24T05:28:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T01:12:30.856436Z","submitted_at":"2024-11-24T05:28:07Z","title":"Chain of Attack: On the Robustness of Vision-Language Models Against Transfer-Based Adversarial Attacks"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2411.15720."}