{"as_of":"2026-08-18T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b32a222f471f1ad8fe06690cfc99e8e1d163c0f795d262cf0480deb9a3d384f3","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:06:24.676479Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T02:57:46.941141Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:16:26.845312Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09446","snapshot_observed_at":"2026-08-03T02:57:46.941141Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.09431","last_updated":"2026-05-24T12:21:22Z","snapshot_observed_at":"2026-08-14T03:56:42.645424Z","submitted_at":"2026-02-10T05:51:02Z","title":"Grounding-Driven Attack: Improving Encoder-based Adversarial Transferability against Large Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T02:57:46.941141Z"},"links":{"cited_paper":"/paper/2501.09446","citing_paper":"/paper/2602.09431"},"observation_digest":"sha256:29f555139b41eac69dbc1ecaafb4dd5edead22e01983dd2a64169889371dbb80","observation_id":"b813acf5-d0c6-4524-b03a-fbfe460883b9","resolution":{"observed_at":"2026-08-03T02:57:46.941141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"cited_work":{"arxiv_id":"2501.09446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09446","snapshot_observed_at":"2026-07-02T02:16:26.845312Z","title":"Double visual defense: Adversarial pre-training and instruction tuning for improving vision-language model robustness.arXiv preprint arXiv:2501.09446, 2025","venue":null,"work_id":"c6654910-62f7-4614-9416-8c1442ff39d2","year":2025},"citing_paper":{"arxiv_id":"2606.03713","last_updated":"2026-08-11T09:33:56Z","snapshot_observed_at":"2026-08-14T23:09:30.355546Z","submitted_at":"2026-06-02T14:34:48Z","title":"Investigating Adversarial Robustness of Multi-modal Large Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T11:11:34.152223Z"},"links":{"cited_paper":"/paper/2501.09446","citing_paper":"/paper/2606.03713"},"observation_digest":"sha256:02ab4f08a260471f51440302a3a49a33fe0c3a37e6d66e5fd946fc2cab1d842e","observation_id":"0ad91002-c2e8-4cf7-879f-29230efe9357","resolution":{"observed_at":"2026-07-02T02:06:27.573666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"cited_work":{"arxiv_id":"2501.09446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09446","snapshot_observed_at":"2026-07-02T02:16:26.845312Z","title":"Double visual defense: Adversarial pre-training and instruction tuning for improving vision-language model robustness.arXiv preprint arXiv:2501.09446, 2025","venue":null,"work_id":"c6654910-62f7-4614-9416-8c1442ff39d2","year":2025},"citing_paper":{"arxiv_id":"2606.03730","last_updated":"2026-08-11T09:26:07Z","snapshot_observed_at":"2026-08-15T00:55:31.878235Z","submitted_at":"2026-06-02T14:49:04Z","title":"Beyond False Stability: High-Noise Drift Gating for Test-Time Adversarial Defenses in Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:30.654255Z"},"links":{"cited_paper":"/paper/2501.09446","citing_paper":"/paper/2606.03730"},"observation_digest":"sha256:71c111dc56c22a4d3c75e78196baca07593aeef3ea4444a66f192875b661c7ed","observation_id":"0372334e-33ec-463c-9677-8bba24ef033d","resolution":{"observed_at":"2026-07-02T02:16:26.847659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09446/citation-record","integrity":"/paper/2501.09446/integrity","json":"/paper/2501.09446/citation-record.json","paper":"/paper/2501.09446"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.088497Z","title":"Vqa: Visual question answering","venue":null,"work_id":"b7b7259f-b69c-40f6-b854-00a99c2b5a72","year":2015},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.504262Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:2ed02bcb8215533b916188ed90efeb6621e56e582c0e0b1eb7894e5d89bdd34c","observation_id":"4e1776f9-a3f9-45c4-8a19-f3093e62184f","resolution":{"observed_at":"2026-08-10T20:06:25.091010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.081489Z","title":"Obfus- cated gradients give a false sense of security: Circumventing defenses to adversarial examples","venue":null,"work_id":"3025055b-4a8c-4016-b301-23fbfbcf4e39","year":2018},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.507367Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:e716e0052548aee602d81337519b58f05219699a88314cdbc5a43be5f0aaae30","observation_id":"1953bcb1-fd59-4b1f-8313-22cd0a0cdf91","resolution":{"observed_at":"2026-08-10T20:06:25.084288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.074693Z","title":"Image hijacking: Adversarial images can control generative models at runtime","venue":null,"work_id":"af20bdda-2d70-488f-88d2-be7269c539ca","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.510904Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:b6505c7604184e59d90dfa5042f21fcd109458dd546feaae73c3771b438d3184","observation_id":"707a7573-b362-4d61-8b22-3a887b380ca3","resolution":{"observed_at":"2026-08-10T20:06:25.077462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09349","last_updated":"2024-07-10T17:32:29Z","snapshot_observed_at":"2026-08-16T14:01:03.012425Z","submitted_at":"2024-04-14T20:14:38Z","title":"Adversarial Robustness Limits via Scaling-Law and Human-Alignment Studies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09349","snapshot_observed_at":"2026-08-10T20:06:24.514368Z","title":"Adversarial robustness limits via scaling-law and human-alignment studies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.514368Z"},"links":{"cited_paper":"/paper/2404.09349","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:7f386b3caea3f48ef9f4533d564108ca14f1333ec36c68845a33cec3f4095883","observation_id":"ce72e92f-bf34-4f07-8a9f-df8aa1fdf273","resolution":{"observed_at":"2026-08-10T20:06:24.514368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.066845Z","title":"Jax: composable transformations of python+ numpy programs","venue":null,"work_id":"4a38892f-d1cd-4970-b610-dcb99f203b15","year":2018},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.517311Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:3a67fda623bbd601123f924d682816d8de71e69250260315f73ab44b62f6b299","observation_id":"05fa27be-7460-4582-8546-3e277b3515bf","resolution":{"observed_at":"2026-08-10T20:06:25.069948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.059783Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":"ebc78137-8643-4676-b52e-e3866c9697d6","year":2017},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.520684Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:502648bfbcf89c2fdf7c448fcd014e9cb8f448eebd6641ffebc3f05df82e0396","observation_id":"a96207da-6122-4dbe-896b-83229788ba33","resolution":{"observed_at":"2026-08-10T20:06:25.062423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.052549Z","title":"Are aligned neural networks adversarially aligned? Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"b2d3411b-5fde-4b5e-a4aa-950d1ad2c731","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.523755Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:ed478034416ff08d23ef0f680d91dbc17b89baa61df88e1036f46cd0e7ca4874","observation_id":"2cbaa20a-ad8f-4af7-b0b4-87e6a423bef5","resolution":{"observed_at":"2026-08-10T20:06:25.055620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.044677Z","title":"Reliable evalua- tion of adversarial robustness with an ensemble of diverse parameter-free attacks","venue":null,"work_id":"ecf2d788-08a0-47f7-bf94-795f7e49dafa","year":2020},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.526408Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:748f66a0d2c473b7e5c53343fe91ed191c4988b53377d37c4b3e15d0f09701a1","observation_id":"48b260d2-c1f2-4246-86e5-5068391c03e4","resolution":{"observed_at":"2026-08-10T20:06:25.047481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.037501Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"2df27093-784f-4739-a2d2-2b8131be6dd0","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.529305Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:ab0a849c0915d40f3c269b399ea50270f7ac0b6a0cce8300c99718891deaf546","observation_id":"e93064c1-2041-4a2d-aeb2-4354a36c88ad","resolution":{"observed_at":"2026-08-10T20:06:25.040227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.029835Z","title":"Robust physical-world attacks on deep learning visual classification","venue":null,"work_id":"8d75e384-931d-4aff-8f6b-7cd0ca7678d5","year":2018},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.532237Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:98f6ddd6a1bd3bdc62498236bd831c2c09d59bd3f670273f81e6c5f114d6c359","observation_id":"0850d889-3fce-4a80-800b-8db8ec7accf4","resolution":{"observed_at":"2026-08-10T20:06:25.033084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T20:06:24.534593Z","title":"Mme: A comprehensive evaluation bench- mark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.534593Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:4e909d9150b1bfe38b07c27986389acae88d8e7201a435ce8cb40e8450f06cdd","observation_id":"757c5b33-d177-4def-8f28-88b475a703ad","resolution":{"observed_at":"2026-08-10T20:06:24.534593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.022462Z","title":"Dat- acomp: In search of the next generation of multimodal datasets","venue":null,"work_id":"2ca7b3f6-1e99-4533-8495-cc97efb2f214","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.537200Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:27f3f6a08982b0467af41b4df18b0eecdd6e9f1bd98ed3f4717e19f898eb8db8","observation_id":"da759870-ac22-4f77-8e9f-c620861829d1","resolution":{"observed_at":"2026-08-10T20:06:25.025313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-18T12:18:02.474208Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-10T20:06:24.539812Z","title":"Figstep: Jailbreaking large vision-language models via typo- graphic visual prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.539812Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:91fae3917a1cf810f7a7ac71248ce9a6d720d5192e4ae9197d5ac961ceab3415","observation_id":"68faee73-b6c2-4a4d-be86-451e438c806a","resolution":{"observed_at":"2026-08-10T20:06:24.539812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.013989Z","title":"Explaining and harnessing adversarial examples","venue":null,"work_id":"f238f4d3-c649-41b5-b293-f91d1c481671","year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.543078Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:9b4a2f4abb18970fa2756d49f00f12e860ac3821bc2d27c76e6df239e235ad9e","observation_id":"788f875e-b592-407a-a22f-0735ed5c26e1","resolution":{"observed_at":"2026-08-10T20:06:25.016699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:25.006258Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"fa5ef07e-aac9-42a8-942a-7a9513edd026","year":2017},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.545967Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:6355818ec68543ee0a2512eaea4330cb2533de0b7122967cec6d7df17006f41d","observation_id":"ee209832-6359-4738-afb7-b08e83a87b18","resolution":{"observed_at":"2026-08-10T20:06:25.009177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08567","last_updated":"2024-06-03T14:15:03Z","snapshot_observed_at":"2026-08-18T07:13:53.447155Z","submitted_at":"2024-02-13T16:06:17Z","title":"Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08567","snapshot_observed_at":"2026-08-10T20:06:24.548987Z","title":"Agent smith: A single image can jailbreak one million multimodal llm agents exponentially fast","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.548987Z"},"links":{"cited_paper":"/paper/2402.08567","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:8cfa6af1596a9df11630338e96df9f95c80cdd111106e04a074e1a8a3300d826","observation_id":"f706e098-4935-48f5-aaf6-3466c55ca202","resolution":{"observed_at":"2026-08-10T20:06:24.548987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.552414Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.552414Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:ca8b3e37149df38e25e66bf60a1a5566804cbb0bace1895bd8d418589d0dad1d","observation_id":"d052b8ce-af60-4f6e-a058-3dda08431dad","resolution":{"observed_at":"2026-08-10T20:06:24.552414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.995317Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":"3de5c8a8-024c-45bb-82de-618df6fc2ba7","year":2022},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.556159Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:1fe40dbbb0e8a4eaa49a88a7128e56f2bc8258deb1596c50a8855589ca68a960","observation_id":"0f472f45-7593-4d83-ae68-a92d9f8a03cc","resolution":{"observed_at":"2026-08-10T20:06:24.998152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.986806Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":"33999374-37bd-4edd-ad36-9cb99328a012","year":2019},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.558546Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:d4dd15ac000d220f4ce82ff1a69923eda87dcceedfb0fc6b7f0e54ba50ce9725","observation_id":"c4971c88-7bc8-4620-a63f-35387a0a2163","resolution":{"observed_at":"2026-08-10T20:06:24.989646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.978790Z","title":"Collecting a large-scale dataset of fine-grained cars.(2013)","venue":null,"work_id":"f4e7a8ae-cc89-4916-901e-ad87043b592c","year":2013},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.561631Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:623662905008f80551fb1009bada5c1b3b61b156c38d3f1712eed659b257cb61","observation_id":"55d586a0-9a53-4bff-bf59-45f2111d4027","resolution":{"observed_at":"2026-08-10T20:06:24.982411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-08-16T13:43:37.667967Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-10T20:06:24.564806Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.564806Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:b6e244311974aa9467bfaa2ccf633f1a5c363f92f07b5fa289e31428f35a842d","observation_id":"b7ccd5bd-2c60-4193-b74e-29a7c531c02b","resolution":{"observed_at":"2026-08-10T20:06:24.564806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.971283Z","title":"An inverse scal- ing law for clip training","venue":null,"work_id":"ad67e9d0-7740-4532-b3f1-8a67ef21bdd1","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.567817Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:0e342dc10a25d2a7c8e67c09f88089c60bbe94f477ee2f8cea71c267f407289b","observation_id":"73bd220d-a2ae-4084-a384-1a02dfbb3eb9","resolution":{"observed_at":"2026-08-10T20:06:24.974131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.964145Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"2c5d8396-f820-4b16-b838-60235e3b8ffc","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.571074Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:28fe1a8ce48db1e7bb547b7e7a55aa90e42e954f78d8b60ee70d3eba24bdbf21","observation_id":"eea723d3-132a-4530-b8ae-21d10ba7601e","resolution":{"observed_at":"2026-08-10T20:06:24.966911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.957170Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":"cd28e86f-8e00-4512-a86f-741f4fc3862d","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.573933Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:d29afaec532b01abd6d7936f9fb97fc80b84fd7c92f1be3f16ef7e36adaf07ee","observation_id":"0e166030-19d9-4a5c-b291-3aa1e18bcf1d","resolution":{"observed_at":"2026-08-10T20:06:24.959996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.576699Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.576699Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:53da0aa95e572e03a924a341edeabbb9a18c1b1f3aff558fa85b618ecb6c90c1","observation_id":"7dce995a-6755-49a4-b97c-b111622e3521","resolution":{"observed_at":"2026-08-10T20:06:24.576699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.946246Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"a52702ce-522e-4884-8cbe-f81bcc424f46","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.579201Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:70696a55f5802ed204f5aaa7cda7ac3027b6b736bf3e7736fdae2f50bd58bf3d","observation_id":"248c01ea-a96a-49b3-995d-e45a0ae1282e","resolution":{"observed_at":"2026-08-10T20:06:24.949057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.938551Z","title":"Visual instruction tuning","venue":null,"work_id":"1b774030-fb63-450e-8b3b-68c1cef804b5","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.582151Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:95b99daa15baa79f76508631c3c5da0ba5e6df9ecf2c85f6de3819d36d91e6e9","observation_id":"ef4277ab-62ff-4b1a-b74b-6eef7ce7000a","resolution":{"observed_at":"2026-08-10T20:06:24.941936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.930668Z","title":"AutoDAN: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":"ba8fa41e-acdc-4df7-a7f7-e0372033178a","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.584530Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:6276ef1be063737776cccb921750dd7b1c8612dc436ee15365785cea04ec998d","observation_id":"5d57b010-6409-4b93-9338-ac143c8aa848","resolution":{"observed_at":"2026-08-10T20:06:24.933651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.586907Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.586907Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:29828b9242fc721fee991fae5eb72b53574a261040537fefc783a095e274e11f","observation_id":"213a7dd0-0c0c-403a-981f-87062b9f6291","resolution":{"observed_at":"2026-08-10T20:06:24.586907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.920119Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"6d37a63c-c10b-4760-a23a-4e0db5011b30","year":2018},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.589981Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:57c1f36853dca0f6165f6ec03d565e5e2109243107223585126e60aad2cbc40c","observation_id":"94369438-5983-40ff-826c-3163b35467b8","resolution":{"observed_at":"2026-08-10T20:06:24.922818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.912864Z","title":"Understanding zero-shot adversarial robust- ness for large-scale models","venue":null,"work_id":"5fa7daab-425e-4205-8e9f-9b6ad72c7599","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.593330Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:93248fe68ceebb3ca8782d48e4e3d5ff244142f29cad7ea8e7a45119baa938ba","observation_id":"5944b3f7-8e89-4ca7-b0c4-327b9ca5cce5","resolution":{"observed_at":"2026-08-10T20:06:24.915549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.595517Z","title":"Deepfool: a simple and accurate method to fool deep neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.595517Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:b679df665cc42934cd2b3182ed2d8c2a6fbbc91ac9188997ffbeb052e06c556e","observation_id":"d556e3a8-f0d7-439f-a070-0d34b539c37a","resolution":{"observed_at":"2026-08-10T20:06:24.595517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.902287Z","title":"Bag of tricks for adversarial training","venue":null,"work_id":"82a1c979-beb4-4b8a-ae0b-6e8b1cb6a2b1","year":2021},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.597881Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:ab6937e4461f054592963b19adda76305986c27f594675d0fbb1aebe37e5667d","observation_id":"cdf56dc0-8e55-4392-8ed8-56becba3d80a","resolution":{"observed_at":"2026-08-10T20:06:24.904859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-10T20:06:24.601160Z","title":"Learning to see but forgetting to fol- low: Visual instruction tuning makes llms more prone to jail- break attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.601160Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:301f8a1b2d2f652c050b1c534c176aacf638767661981bb729ca7464dda7bde3","observation_id":"f12e9d07-da67-49af-9d46-e5fc31267973","resolution":{"observed_at":"2026-08-10T20:06:24.601160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.894642Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":"235c2bdd-4912-4e2c-87d6-08aa7b1d13ed","year":2015},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.604997Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:e29ededfb8bd3a46d5833b6d07d953416081ecdb1cb4cf2edd6c98570de361c1","observation_id":"dbc0083e-1950-48ec-869b-95fdb093f31f","resolution":{"observed_at":"2026-08-10T20:06:24.897410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13213","last_updated":"2023-08-16T22:38:55Z","snapshot_observed_at":"2026-08-16T15:21:48.065276Z","submitted_at":"2023-06-22T22:13:03Z","title":"Visual Adversarial Examples Jailbreak Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13213","snapshot_observed_at":"2026-08-10T20:06:24.607796Z","title":"Visual adversarial exam- ples jailbreak large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.607796Z"},"links":{"cited_paper":"/paper/2306.13213","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:92821b96c0d4f48bb1fb1abef37fb83174fe6b2bbe58055230b8dc9d6475b779","observation_id":"29cce8ce-5de9-4ca8-8843-04b3bd982534","resolution":{"observed_at":"2026-08-10T20:06:24.607796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.887768Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":"77a9641c-4b5f-45c9-b9a7-85a36ca79d12","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.611286Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:1b290a8fba784927d52ea03a84ca8eff4072d14fb2a1a3252822697d8b14e8fc","observation_id":"fcc9fe5d-90ee-4e2d-95bc-428aa1ce8f2c","resolution":{"observed_at":"2026-08-10T20:06:24.890475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.880298Z","title":"Fine-tuning aligned language models compromises safety, even when users do not intend to! In The Twelfth International Conference on Learning Representations, 2024","venue":null,"work_id":"95512f72-b529-4d61-8ea6-4900be6bcbf7","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.614535Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:891cb33cef7351d671ff117abb5a5c3938b17320adfaab3844aab4b5def62906","observation_id":"6b7bd383-f61b-4a93-879d-b3fda75be958","resolution":{"observed_at":"2026-08-10T20:06:24.883310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.872891Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d04d9a80-26cb-450a-8f1c-86ddd0cb9ea0","year":2021},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.617015Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:124f503e8b2f5d72e91ced0e2e8db4308734581805f8852fde9dd6ee0456b62d","observation_id":"26aeb469-7347-48ec-9aee-c7d26101fb77","resolution":{"observed_at":"2026-08-10T20:06:24.875761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15211","last_updated":"2024-12-16T01:20:42Z","snapshot_observed_at":"2026-08-16T13:32:20.660928Z","submitted_at":"2024-07-21T16:27:24Z","title":"Failures to Find Transferable Image Jailbreaks Between Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15211","snapshot_observed_at":"2026-08-10T20:06:24.619802Z","title":"When do universal image jailbreaks transfer between vision-language models? arXiv preprint arXiv:2407.15211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.619802Z"},"links":{"cited_paper":"/paper/2407.15211","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:f78067d398ea4fdcca309fe938a9f2706f526182f1ad829480859ecc3f60dfe2","observation_id":"82a9f85a-2e5b-4e8a-a2f7-5997a119c15c","resolution":{"observed_at":"2026-08-10T20:06:24.619802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.863763Z","title":"on the adversar- ial robustness of multi-modal foundation models","venue":null,"work_id":"ae0f432a-334d-4cd3-a801-dd835336f5e4","year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.623177Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:d1f7a6b5023f39265b0b5596be5a970a797fb08d528cd34b30ba51fded61f929","observation_id":"0c0b25ae-eb55-48ca-905e-2a9518b4b3e2","resolution":{"observed_at":"2026-08-10T20:06:24.867179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12336","last_updated":"2024-06-05T15:32:03Z","snapshot_observed_at":"2026-08-16T14:17:14.673153Z","submitted_at":"2024-02-19T18:09:48Z","title":"Robust CLIP: Unsupervised Adversarial Fine-Tuning of Vision Embeddings for Robust Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12336","snapshot_observed_at":"2026-08-10T20:06:24.626038Z","title":"Robust clip: Unsupervised ad- versarial fine-tuning of vision embeddings for robust large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.626038Z"},"links":{"cited_paper":"/paper/2402.12336","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:c115e7d2c212f63d79792269e6f8c891336653566c832a551745250f21472adc","observation_id":"07f5391d-2958-48de-be57-a17e25675266","resolution":{"observed_at":"2026-08-10T20:06:24.626038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.855815Z","title":"Adversarial training for free! NeurIPS, 32, 2019","venue":null,"work_id":"7eb18f8f-3540-49e6-8f60-d03293b486d8","year":2019},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.629344Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:92327693feb499e8af748a50ef4786397609fe2f62aac74f51c0b128589d0bf0","observation_id":"ece5ae28-d52b-4aab-b852-f61b17148b5e","resolution":{"observed_at":"2026-08-10T20:06:24.858541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.847824Z","title":"Towards vqa models that can read","venue":null,"work_id":"609536b2-5ef1-4bd8-95ad-93b616f5737d","year":2019},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.632406Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:9397b58cbbf4552e1d9de071c7af6591de7fbcf75db3f539c3b7397a9f87ac3f","observation_id":"72eee1f7-2fd3-4259-b926-a77f6e53ff14","resolution":{"observed_at":"2026-08-10T20:06:24.850576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-16T07:24:08.156932Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-10T20:06:24.636036Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.636036Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:d77add6ebd1d3e60c64504437dca2b5eb9bba90180a44ca7642c06a88eb71342","observation_id":"1b70138a-de70-458b-9c42-0742c26f3845","resolution":{"observed_at":"2026-08-10T20:06:24.636036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.839726Z","title":"In- triguing properties of neural networks","venue":null,"work_id":"bf9a0135-cfaa-485a-b842-1cacea90440f","year":2014},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.638728Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:cea058632b8af3e3748c676b1d7e1f6cf25b97f16f689ed0f352dab0c98d14ad","observation_id":"8d0c19ab-51f6-4a05-b6e2-23655501e6b0","resolution":{"observed_at":"2026-08-10T20:06:24.843355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12152","last_updated":"2019-09-09T08:09:25Z","snapshot_observed_at":"2026-08-16T03:57:44.683156Z","submitted_at":"2018-05-30T18:00:32Z","title":"Robustness May Be at Odds with Accuracy","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.12152","snapshot_observed_at":"2026-08-10T20:06:24.641502Z","title":"Robustness may be at odds with accuracy","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.641502Z"},"links":{"cited_paper":"/paper/1805.12152","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:17f024a42acf7cc897ec7a2c58518427669971747d0933dbb5749125e2dd92f4","observation_id":"51cfb025-1c29-4539-8f49-511e486369b2","resolution":{"observed_at":"2026-08-10T20:06:24.641502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.644618Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.644618Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:07249fff6c29428870f4366e56c294d2752bf75c565f3e162d43745fa92b7f17","observation_id":"e56ae7a6-cc41-4e8d-ae8c-a165d86614a5","resolution":{"observed_at":"2026-08-10T20:06:24.644618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.828823Z","title":"Revisiting adversarial training at scale","venue":null,"work_id":"2e2e1a79-cfbc-4ac6-877a-ebd0e43aeee4","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.647293Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:f5b4785abadf5214e063a5a5194f14bc78024de83da3fdeef45cc0aa4a9b5b85","observation_id":"53a731f3-6e49-4c44-9fc6-2f7dcd64e6c4","resolution":{"observed_at":"2026-08-10T20:06:24.831539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.821164Z","title":"Zico Kolter","venue":null,"work_id":"2af0ef3d-6f11-4100-ac33-8b54aabd5b0d","year":2020},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.650544Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:6ae4bd60585ae95cc200ebaa0a17d42993475cc546f41c3e6cf2e6e325a7ba6c","observation_id":"6db1a99e-93fb-4d9f-a784-2ea8cbbe4510","resolution":{"observed_at":"2026-08-10T20:06:24.823804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.811760Z","title":"On the safety concerns of deploying 14 llms/vlms in robotics: Highlighting the risks and vulnerabil- ities","venue":null,"work_id":"b49ab694-33db-4f2e-ac77-c6dfc6a1e098","year":2024},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.654010Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:4f6a2cb84be0dcf6cbaa8833c1bef8f6a59f3b670a8cbefa1a4e6d36b29db7f0","observation_id":"57a563a4-ff85-4f1e-bad9-216cae047c51","resolution":{"observed_at":"2026-08-10T20:06:24.815350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.803843Z","title":"Feature denoising for improving ad- versarial robustness","venue":null,"work_id":"f410b2d9-1df9-4d4d-98e2-d96d8464c4af","year":2019},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.656846Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:f6222a4bcca5754e58acb583392dc0b68b776a58fba1c50bf3836214a1905ed5","observation_id":"c6283cf5-d438-48d9-aee3-b1a49af7f99f","resolution":{"observed_at":"2026-08-10T20:06:24.806475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.794055Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":"6f4d3092-6939-4190-9470-319821cd0f8e","year":2022},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.659428Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:6213840b098080f98bab9b882083f86429f5c6ef278983fcdc40c915c48a3a32","observation_id":"16f13be1-37b3-4f63-a5f0-faf8bdbfc405","resolution":{"observed_at":"2026-08-10T20:06:24.796927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.786175Z","title":"Towards robust resnet: A small step but a giant leap","venue":null,"work_id":"b6e6d651-c9cf-4e1e-b3fa-6781353aab49","year":2019},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.662936Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:8fcdadd5cb51b911db37f1f12a96ee561b9300aac4c7782dbebcff38034dd866","observation_id":"732067d3-7c24-4928-b2c3-dbf6bdb75365","resolution":{"observed_at":"2026-08-10T20:06:24.789140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.778961Z","title":"Attacks which do not kill training make adversarial learning stronger","venue":null,"work_id":"49c0d26f-6131-4cb9-bce1-4ec4f712a395","year":2020},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.666337Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:f7369cfe83a10504ec593e55b305944005315e6bc57eff619ca0540da15e050d","observation_id":"d4e81124-00cf-49c2-bff3-08dbdddc8ecc","resolution":{"observed_at":"2026-08-10T20:06:24.781588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:06:24.768675Z","title":"Geometry-aware instance-reweighted adversarial training","venue":null,"work_id":"42eace40-c86a-4f22-984a-97d74c59a51a","year":2021},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.669605Z"},"links":{"citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:f862ebfe3d99199b0380efd277d38eede2fd0551ed14920fd603d8b18e735f11","observation_id":"ec52100a-d665-4119-83df-c3dd69b5c902","resolution":{"observed_at":"2026-08-10T20:06:24.773519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-10T20:06:24.673382Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.673382Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:396cbb791f7caaf21d2639ab8781d5308d99a8f68fbff42acd067fa5e0b9b33f","observation_id":"22610ae9-0f3f-4e3e-bb3d-a7a28ae35c7f","resolution":{"observed_at":"2026-08-10T20:06:24.673382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T20:06:24.676479Z","title":"Universal and transferable ad- versarial attacks on aligned language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:06:24.676479Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.09446"},"observation_digest":"sha256:c47913b6abaa9d402c56cc6bf16ae6e7b0d5b0e28d785aa93e38f2098121c2d0","observation_id":"5a0fbdf1-167c-4dfc-8fe4-5e62dee3e157","resolution":{"observed_at":"2026-08-10T20:06:24.676479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09446","last_updated":"2025-04-07T19:45:45Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T07:18:02.926145Z","submitted_at":"2025-01-16T10:20:48Z","title":"Double Visual Defense: Adversarial Pre-training and Instruction Tuning for Improving Vision-Language Model Robustness"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 3 inbound Pith citation observations for arXiv:2501.09446."}