{"as_of":"2026-08-18T04:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:808d5b2878999c57f3c1bc8b4b9c7832b0371267fcd0804a1c014a1285d9b67b","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:02:41.029778Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.17759/citation-record","integrity":"/paper/2510.17759/integrity","json":"/paper/2510.17759/citation-record.json","paper":"/paper/2510.17759"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T09:02:36.585841Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:36.585841Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:5297ec8a7ad4632fc301675a25689e1fe70a01f533a39ca461c0eb7047ac45a5","observation_id":"091f8ee0-ab77-4c76-aad0-fd5b72694fcc","resolution":{"observed_at":"2026-08-04T09:02:36.585841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:36.693293Z","title":"Trust-vlm: Thorough red-teaming for uncovering safety threats in vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:36.693293Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:8d50b3018ffb1119e8f57fd120a34e5c19f703a524de14b03c61e832a2c23864","observation_id":"c6ff87cc-55f6-4fd3-83f7-8132cfddcc6e","resolution":{"observed_at":"2026-08-04T09:02:36.693293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05087","last_updated":"2025-08-07T07:14:01Z","snapshot_observed_at":"2026-08-05T23:37:58.798985Z","submitted_at":"2025-08-07T07:14:01Z","title":"JPS: Jailbreak Multimodal Large Language Models with Collaborative Visual Perturbation and Textual Steering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05087","snapshot_observed_at":"2026-08-04T09:02:36.800236Z","title":"Jps: Jailbreak multimodal large language models with collaborative visual perturbation and textual steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:36.800236Z"},"links":{"cited_paper":"/paper/2508.05087","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:c71a140d83e458365122d7e7fc6adeaf28f6d47dd3d4b11430a46c017941322e","observation_id":"822e213c-bd6e-4428-a4fe-d57ff9776962","resolution":{"observed_at":"2026-08-04T09:02:36.800236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:36.953149Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:36.953149Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:dfe7d018a769a5db2fa9ec908e19370113ff19c1b6c32855b2b916598f84e06b","observation_id":"13326619-084b-42db-916e-3bb3d21b4adf","resolution":{"observed_at":"2026-08-04T09:02:36.953149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.046720Z","title":"Eta: Evaluating then aligning safety of vision language models at inference time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.046720Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:18cf6e35fc232658a0a9d30f04b64dca23e386c5629b5cf7091b4873c2998f8b","observation_id":"8eaa35df-b236-42ce-a2d1-b764b1728477","resolution":{"observed_at":"2026-08-04T09:02:37.046720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.148757Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.148757Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:02013fba6378345ec3744f698aab6a339a52ee59538c7a873869bc6e9228d49f","observation_id":"6962335d-e8ab-44d5-97ea-00b444f5db40","resolution":{"observed_at":"2026-08-04T09:02:37.148757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.370781Z","title":"Figstep: Jailbreaking large vision-language models via typographic visual prompts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.370781Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:f01c6118001e2d7e048c599bd6c8ddc87500929641c2a279bc12e207251202a4","observation_id":"7d688941-46ad-4aaf-9f2d-088d0a311427","resolution":{"observed_at":"2026-08-04T09:02:37.370781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08410","last_updated":"2025-03-06T01:45:26Z","snapshot_observed_at":"2026-08-17T22:41:35.008746Z","submitted_at":"2024-11-13T07:57:19Z","title":"The VLLM Safety Paradox: Dual Ease in Jailbreak Attack and Defense","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08410","snapshot_observed_at":"2026-08-04T09:02:37.531373Z","title":"The vllm safety paradox: Dual ease in jailbreak attack and defense","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.531373Z"},"links":{"cited_paper":"/paper/2411.08410","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:b77cc543dfaa8fd98d839d0aee0979f674c483146d8910aeda72517042322f17","observation_id":"9adf6efa-39f9-4f04-a303-024b5adda4f7","resolution":{"observed_at":"2026-08-04T09:02:37.531373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.657331Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.657331Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:87b315bfb5ac470ca0ef4209d8101acba03ab1ed1f64dd3dad6b49c0bcd0752d","observation_id":"414a6897-861b-4f39-b9c4-a1ef332f6833","resolution":{"observed_at":"2026-08-04T09:02:37.657331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.787749Z","title":"Images are achilles' heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.787749Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:588bc0b2a05dd3500ab25f59eecf03acf6c5cbb5010985d56e639ec5bd611aa4","observation_id":"a4b938b8-0588-4903-b0f2-26c079ca1d0a","resolution":{"observed_at":"2026-08-04T09:02:37.787749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:37.935623Z","title":"Images are achilles’ heel of alignment: Exploiting visual vulnerabilities for jailbreaking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:37.935623Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:75d4c2ea66e27a8f407701808ac126e56fdadef9954b4cd9fad8f5300f03ac40","observation_id":"c709635b-4625-4f7d-b9fa-534eb2b0a28c","resolution":{"observed_at":"2026-08-04T09:02:37.935623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:38.064964Z","title":"Vl-trojan: Multimodal instruction backdoor attacks against autoregressive visual language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.064964Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:69ccdac1b99090da905fbef82625ddf205575a36082f6defe6bec6e5d31c9794","observation_id":"bf9bab15-904c-455e-bd2e-9bdf7b4e6b1f","resolution":{"observed_at":"2026-08-04T09:02:38.064964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:38.117232Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.117232Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:002c4129228062a31b719875aa8371dc848ddeb62232cce3cd6e12b5467500c0","observation_id":"72f10972-37fe-4be9-af0f-d6733e68f3ec","resolution":{"observed_at":"2026-08-04T09:02:38.117232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:38.191281Z","title":"Arondight: Red teaming large vision language models with auto-generated multi-modal jailbreak prompts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.191281Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:2f3e443a5444b81366b15ae0167fa030470404e991c6304a631aadb20a687913","observation_id":"257b9b0b-1e0d-493c-b832-35d95ca85419","resolution":{"observed_at":"2026-08-04T09:02:38.191281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22666","last_updated":"2026-05-30T16:23:21Z","snapshot_observed_at":"2026-08-14T08:28:56.327756Z","submitted_at":"2025-06-27T22:22:00Z","title":"VERA: Variational Inference Framework for Jailbreaking Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22666","snapshot_observed_at":"2026-08-04T09:02:38.279815Z","title":"Vera: Variational inference framework for jailbreaking large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.279815Z"},"links":{"cited_paper":"/paper/2506.22666","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:c50248e67b11f0cb1798fbce3d74da4f413d02f50b671c49fcdc03740c7910eb","observation_id":"81994794-73d5-4737-902b-fadf39160117","resolution":{"observed_at":"2026-08-04T09:02:38.279815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:38.492727Z","title":"Backdooring vision-language models with out-of-distribution data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.492727Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:6a53d70de2793e18b7553965141ae8d37b9a77dfc82a9e62cc4c13e6175aa2b2","observation_id":"c588d445-d65f-4da7-bfee-0f88f4afb94e","resolution":{"observed_at":"2026-08-04T09:02:38.492727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20773","last_updated":"2024-06-12T07:13:48Z","snapshot_observed_at":"2026-08-17T15:14:45.354691Z","submitted_at":"2024-05-25T17:17:18Z","title":"Visual-RolePlay: Universal Jailbreak Attack on MultiModal Large Language Models via Role-playing Image Character","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20773","snapshot_observed_at":"2026-08-04T09:02:38.637172Z","title":"Visual-roleplay: Universal jailbreak attack on multimodal large language models via role-playing image character","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.637172Z"},"links":{"cited_paper":"/paper/2405.20773","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:090f6044fccb75e351a7fb6c6afbf1f85f10d069f4313fcea1595072fd9a105a","observation_id":"59cd7582-ec3a-4e5a-9246-11362bc47eb0","resolution":{"observed_at":"2026-08-04T09:02:38.637172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:38.813023Z","title":"Forsyth, and Dan Hendrycks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.813023Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:c7197fbb098bc312a16eadfa29584618d4f9d16d97359013e221823b75bb982c","observation_id":"47eb88d5-8b7d-4544-b473-3a07b91582a7","resolution":{"observed_at":"2026-08-04T09:02:38.813023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02309","last_updated":"2024-02-04T01:29:24Z","snapshot_observed_at":"2026-08-16T14:21:47.913147Z","submitted_at":"2024-02-04T01:29:24Z","title":"Jailbreaking Attack against Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02309","snapshot_observed_at":"2026-08-04T09:02:38.962519Z","title":"Jailbreaking attack against multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:38.962519Z"},"links":{"cited_paper":"/paper/2402.02309","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:0c0beebf5147fe939c0b6bb63962c38eba8449151d8e0c6a1379126e91f72979","observation_id":"497efb19-bc19-44ac-8cc9-4ceb95cea2f9","resolution":{"observed_at":"2026-08-04T09:02:38.962519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.128534Z","title":"Hello gpt-4o, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.128534Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:c3dc578f630996409a2c4ac70395cb1fcf92ba6e10f83d336567711c6cd45859","observation_id":"4649dad8-2c8f-4f16-9969-4600e5505cf2","resolution":{"observed_at":"2026-08-04T09:02:39.128534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.254091Z","title":"Gpt-4o mini: Advancing cost-efficient intelligence, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.254091Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:75c87db37089bc37d608756d84f94d7cdd509a4de16fd60634594ab1a708a95e","observation_id":"da2bd73e-ae9c-44d6-a656-f1326093b6b4","resolution":{"observed_at":"2026-08-04T09:02:39.254091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04403","last_updated":"2024-05-07T15:29:48Z","snapshot_observed_at":"2026-08-16T13:54:37.905279Z","submitted_at":"2024-05-07T15:29:48Z","title":"Learning To See But Forgetting To Follow: Visual Instruction Tuning Makes LLMs More Prone To Jailbreak Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04403","snapshot_observed_at":"2026-08-04T09:02:39.371506Z","title":"Learning to see but forgetting to follow: Visual instruction tuning makes llms more prone to jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.371506Z"},"links":{"cited_paper":"/paper/2405.04403","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:7b4cea7c9d22ffe2e6cd61aa5922e086083c688bab86591a0291f2bfd934e7d2","observation_id":"dadd5531-ff1d-44e6-aedc-3ccc2cf2827b","resolution":{"observed_at":"2026-08-04T09:02:39.371506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.498249Z","title":"Visual adversarial examples jailbreak aligned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.498249Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:2618bc21a50d0cb977c1e2985588d509519b1f32c12c39f7d46d1427f40f609b","observation_id":"44df4ca0-2727-458e-80f4-516314822216","resolution":{"observed_at":"2026-08-04T09:02:39.498249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00626","last_updated":"2025-02-13T03:11:20Z","snapshot_observed_at":"2026-08-16T14:22:30.064475Z","submitted_at":"2024-02-01T14:41:20Z","title":"Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00626","snapshot_observed_at":"2026-08-04T09:02:39.623038Z","title":"Vision-llms can fool themselves with self-generated typographic attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.623038Z"},"links":{"cited_paper":"/paper/2402.00626","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:556ab84b64f679967b469610632aa27edc7f64a2a495c24126feb7dc0fcba2a9","observation_id":"ae799f24-33b2-466b-b074-5fb104fdb242","resolution":{"observed_at":"2026-08-04T09:02:39.623038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.794461Z","title":"Jailbreak in pieces: Compositional adversarial attacks on multi-modal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.794461Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:03d0628fb460755d3b5e363c14329f97e85fb2627c77636471a19d098e3dd60c","observation_id":"2549ffbb-e9e0-43bd-af0f-37b5366acbe2","resolution":{"observed_at":"2026-08-04T09:02:39.794461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.855246Z","title":"A strongreject for empty jailbreaks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.855246Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:0f4e659893f9e14f9c01ced25bd79ad17945e0f856298d79f79fccb950cd252e","observation_id":"8ec290b4-3d51-490c-9ec3-ad4fe12b499a","resolution":{"observed_at":"2026-08-04T09:02:39.855246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:39.941181Z","title":"Imgtrojan: Jailbreaking vision-language models with ONE image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:39.941181Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:98731952ca04c64ef3740aa87891504783be367c1135784cc509b1fe6424622b","observation_id":"5aa58fde-4c0b-4fa3-9308-6ec03bda1952","resolution":{"observed_at":"2026-08-04T09:02:39.941181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.051324Z","title":"Ideator: Jailbreaking and benchmarking large vision-language models using themselves","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.051324Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:67411f0e81aaf07c360f61338a2a81ba0daea126addc8feae6616b82d5fa3c83","observation_id":"7c02fb54-f84d-4526-8ab4-26af9073ccc9","resolution":{"observed_at":"2026-08-04T09:02:40.051324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.152235Z","title":"Jailbreak large vision-language models through multi-modal linkage","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.152235Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:20e9ba9f7f563c2a388cf7ab532e260adfc4370b0faf48bc7fdeb940500fc381","observation_id":"7e210163-3f8a-407e-8757-f27ce44d7a38","resolution":{"observed_at":"2026-08-04T09:02:40.152235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.234142Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.234142Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:8366c6c8286da7f1eaf7bd14e6b0311e58b1e5b7f4f9c909abc1d6138c7567e9","observation_id":"52927ac3-116f-4a00-bce0-c5ab5b265af2","resolution":{"observed_at":"2026-08-04T09:02:40.234142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.324350Z","title":"Distraction is all you need for multimodal large language model jailbreaking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.324350Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:81af6a08f1690c91e7f51d0c683e206bbdaa80c1a4ec7493cb755bc2f4b43aa7","observation_id":"91f7918b-66f7-4817-ab8c-7c893431ab87","resolution":{"observed_at":"2026-08-04T09:02:40.324350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.441757Z","title":"Anyattack: Towards large-scale self-supervised adversarial attacks on vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.441757Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:db4ed33b2fa07e128f97775391b1b2d7ec579fb7ea238c36389a97ef9c7bad3a","observation_id":"daee661d-3b7b-47f8-a12d-ecb072bc89bb","resolution":{"observed_at":"2026-08-04T09:02:40.441757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-04T09:02:40.543643Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.543643Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:b08de772d4e5885aef7c3de2e1d1dfc05b8b54031adcee87c0506f6d9c1055ab","observation_id":"74d883df-13ad-462b-9443-1746eb1de9d7","resolution":{"observed_at":"2026-08-04T09:02:40.543643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.666405Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.666405Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:eb3700ddca2776dc224713b7d4596fd3d4e7395e14a2a379c06afea2aa834486","observation_id":"573a73fc-0bb4-4d46-a44b-f90e820b36ac","resolution":{"observed_at":"2026-08-04T09:02:40.666405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.833370Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.833370Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:5d26ff27b75ab9fdbae44606a6901ac1031f7908592f126ca893117e1b7a25fc","observation_id":"c2d0ce8c-4fe0-4f23-8812-cf1c2369cf0a","resolution":{"observed_at":"2026-08-04T09:02:40.833370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:40.913886Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:40.913886Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:206948fc89574b605d6c0b8b9aa4b5ef0e73801314fcc70daf070e1c393d8f7e","observation_id":"399611c8-40de-44ec-86f1-68bd2449fc8c","resolution":{"observed_at":"2026-08-04T09:02:40.913886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T09:02:41.029778Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T09:02:41.029778Z"},"links":{"citing_paper":"/paper/2510.17759"},"observation_digest":"sha256:4c0dfbc43f8d5b8301711e3e4f33b687907d938662a4bf7d98b14e58cf13eb12","observation_id":"488101bd-a5ae-4d55-91c9-568c30c5f659","resolution":{"observed_at":"2026-08-04T09:02:41.029778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.17759","last_updated":"2026-05-26T07:09:27Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T08:28:22.520272Z","submitted_at":"2025-10-20T17:12:10Z","title":"VERA-V: Variational Inference Framework for Jailbreaking Vision-Language Models"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2510.17759."}