{"as_of":"2026-08-09T14:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e83b916948adfd2c707ef5e7113a7d16e888c1c298f102088a54f583d0a9535","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:04:01.363663Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:23:28.107852Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2502.05206","last_updated":"2026-04-14T16:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-02T05:14:22Z","title":"Safety at Scale: A Comprehensive Survey of Large Model and Agent Safety","version":6},"reference_index":243,"source":"pdf_text","source_observed_at":"2026-05-23T04:39:04.591722Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2502.05206"},"observation_digest":"sha256:415445f82a0918b4b0277dc386589e7dc45d8a75153551dcb56d341cfd16e326","observation_id":"c45f3868-043e-4b3e-98c7-f58623422f7e","resolution":{"observed_at":"2026-05-23T04:42:34.230016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T15:04:01.363663Z","title":"Pick up the alphabet soup and place it in the basket","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16640","last_updated":"2025-05-22T13:12:46Z","snapshot_observed_at":"2026-08-07T14:55:29.164249Z","submitted_at":"2025-05-22T13:12:46Z","title":"BadVLA: Towards Backdoor Attacks on Vision-Language-Action Models via Objective-Decoupled Optimization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:01.363663Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2505.16640"},"observation_digest":"sha256:921dc6cc7ca34a76b88f3d45baed2e5d6c92136e4e647064bbc98990907b0429","observation_id":"b9b58612-b4bb-4b69-a49d-d0ceda8543f4","resolution":{"observed_at":"2026-08-07T15:04:01.363663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T14:29:34.741589Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18770","last_updated":"2025-05-24T16:20:06Z","snapshot_observed_at":"2026-08-07T14:23:43.806027Z","submitted_at":"2025-05-24T16:20:06Z","title":"Dual-Path Stable Soft Prompt Generation for Domain Generalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:29:34.741589Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2505.18770"},"observation_digest":"sha256:c944c871f73d68894eff4644aa34343a344df0f99843b3864e9b0ce53bc1989d","observation_id":"ed9c31f9-b857-487a-bd06-383e5ae4aa40","resolution":{"observed_at":"2026-08-07T14:29:34.741589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T10:40:49.610244Z","title":"Revisiting the adversarial robustness of vision lan- guage models: a multimodal perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.610244Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2ee37e4a08985c28174dc845c15ed5a0611b9ca4f627f0e07f4b5c76b1c26f06","observation_id":"48fb0b46-4211-47e3-ade7-8dedcfe9dfa8","resolution":{"observed_at":"2026-08-07T10:40:49.610244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-06T22:23:50.267956Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21874","last_updated":"2025-06-27T03:13:47Z","snapshot_observed_at":"2026-08-06T22:14:36.819384Z","submitted_at":"2025-06-27T03:13:47Z","title":"On the Feasibility of Poisoning Text-to-Image AI Models via Adversarial Mislabeling","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:23:50.267956Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.21874"},"observation_digest":"sha256:3059579459a623504225f0915951ab26d6f7ccbf5af098198ea2f360d9d00eba","observation_id":"6cdb1c89-ffa7-413e-98b4-26347ee70ee5","resolution":{"observed_at":"2026-08-06T22:23:50.267956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-06T11:54:43.081752Z","title":"”Revisiting the Adversarial Robustness of Vi- sion Language Models: a Multimodal Perspective” arXiv preprint arXiv:2404.19287 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22304","last_updated":"2025-07-30T00:34:20Z","snapshot_observed_at":"2026-08-09T09:49:58.938010Z","submitted_at":"2025-07-30T00:34:20Z","title":"Invisible Injections: Exploiting Vision-Language Models Through Steganographic Prompt Embedding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:54:43.081752Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2507.22304"},"observation_digest":"sha256:89cc1f98af2fafae0550bd6a81d06ed0270672de61ad808d244d70ff62067e9d","observation_id":"d3863703-51e5-41df-9d6c-1d1c333341cb","resolution":{"observed_at":"2026-08-06T11:54:43.081752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T15:23:13.318310Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:e8373f00128c31c7503de25e23402c38100cbd44bad7e787929ed6d303bfea10","observation_id":"460e04dd-8b0b-4288-91bb-5d1f87039018","resolution":{"observed_at":"2026-05-18T15:26:33.883060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2509.15435","last_updated":"2026-05-19T14:30:01Z","snapshot_observed_at":"2026-07-06T22:30:17.163909Z","submitted_at":"2025-09-18T21:17:23Z","title":"ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T21:28:59.898029Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2509.15435"},"observation_digest":"sha256:bf23ce875dfd01e7e65dce73f6040d054c41d8d6083f000ecfad3f5160789ee2","observation_id":"7178a73d-70d6-497f-a870-60ef53d4a74a","resolution":{"observed_at":"2026-05-21T21:30:39.418151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-03T07:47:37.588939Z","title":"P., Zhao, Q., and Chen, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.19210","last_updated":"2026-06-09T16:01:52Z","snapshot_observed_at":"2026-08-06T16:38:35.610168Z","submitted_at":"2026-01-27T05:24:45Z","title":"Contrastive Spectral Rectification: Test-Time Defense towards Zero-shot Adversarial Robustness of CLIP","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T07:47:37.588939Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2601.19210"},"observation_digest":"sha256:2e6ffb93731eff3523392003c7e25faaf10f308cc18b7ec18c9df713a08567b7","observation_id":"25df41f2-ed47-49fe-b0ad-c51c755b6b34","resolution":{"observed_at":"2026-08-03T07:47:37.588939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-08T13:23:13.998293Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:29.058335Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:40340f860bd5735433dc69f56853f855aac6030bb905f1e7675d23d35703b26d","observation_id":"537782d0-b461-44ba-a0c9-ee9e00e5ff48","resolution":{"observed_at":"2026-05-13T19:48:11.625968Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-02T16:52:02.261328Z","title":"Mandic, Qibin Zhao, and Badong Chen","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-08T13:23:13.998293Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:02.261328Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:a9814d3248713db7f84c5be999c5357744715e678d16719635bfa0b694c2f370","observation_id":"361705f3-d9fa-4e77-a6f4-173ccdcbdf28","resolution":{"observed_at":"2026-08-02T16:52:02.261328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.13213","last_updated":"2026-05-13T09:06:21Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T09:06:21Z","title":"Hierarchical Attacks for Multi-Modal Multi-Agent Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-14T20:16:30.070819Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.13213"},"observation_digest":"sha256:975178934de5a50a8b13aab974e7baefcdce3af7cdceca86f7564e466d2b0d47","observation_id":"ca664a2a-660c-4bd0-8455-5fd486f25e56","resolution":{"observed_at":"2026-05-14T20:19:27.931230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.17577","last_updated":"2026-05-17T18:07:08Z","snapshot_observed_at":"2026-08-03T01:04:57.342492Z","submitted_at":"2026-05-17T18:07:08Z","title":"TAME: Test-Time Adversarial Prompt Tuning via Mixture-of-Experts for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T14:20:49.278545Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.17577"},"observation_digest":"sha256:3c575ee7c3b46e9d784b8e90e2b6d667a30e9b7f1e1a546f40d7c078003c33fc","observation_id":"ef32f8f9-1cf9-435e-9468-f114b735f816","resolution":{"observed_at":"2026-05-20T14:23:21.496636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":"2404.19287","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-06-29T13:23:28.107852Z","title":"Revisiting the adversarial robustness of vision language models: a multimodal perspective","venue":null,"work_id":"f81621fe-6f41-4ce4-b31c-62776bc33bf1","year":2024},"citing_paper":{"arxiv_id":"2605.28609","last_updated":"2026-05-27T15:24:31Z","snapshot_observed_at":"2026-08-03T19:09:23.628613Z","submitted_at":"2026-05-27T15:24:31Z","title":"JECA^2: Judgment-Explanation Consistent Adversarial Attack against Forensic Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T13:18:46.414179Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2605.28609"},"observation_digest":"sha256:2c2128a23c5da9354dab6f62d7c06099aa4d83a8c2903aa377207d4833c5a00d","observation_id":"9e9b3f9d-0f8a-47cf-ae78-e3f053369026","resolution":{"observed_at":"2026-06-29T13:23:28.109593Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2404.19287/citation-record","integrity":"/paper/2404.19287/integrity","json":"/paper/2404.19287/citation-record.json","paper":"/paper/2404.19287"},"outbound":[],"paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2404.19287."}