{"as_of":"2026-08-10T12:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bde16a256d812cad2df867760261ec1d7c2479df81f270f78305f1cc667e9cd1","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:12:03.631575Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00817/citation-record","integrity":"/paper/2507.00817/integrity","json":"/paper/2507.00817/citation-record.json","paper":"/paper/2507.00817"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T21:12:03.460828Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.460828Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:7237e2aaed1114ee554547c5c1894fffb532782b9506146692be46d2f003f3b1","observation_id":"ab9a3c74-bce9-475f-beff-8717619f3c63","resolution":{"observed_at":"2026-08-06T21:12:03.460828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:12:03.466590Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.466590Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:89405d26ace1b181935e0725323c465302c44f736d88d1b3aff606d78f6b3d2f","observation_id":"e405321d-415a-415e-a4c0-01d13ab22267","resolution":{"observed_at":"2026-08-06T21:12:03.466590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:12:03.471197Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.471197Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:6ad240198857d1a4230968b40a94126c6681371643a9a6d44f092d0d3c9cb8d0","observation_id":"d3e09ca4-f9bf-44ba-b2b3-5280009a6fc9","resolution":{"observed_at":"2026-08-06T21:12:03.471197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.296505Z","title":"Rethinking model ensemble in transfer-based adversarial attacks","venue":null,"work_id":"3b187de3-5406-4a5c-a426-a8c587b8b6fb","year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.475888Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:36c144a74ab70f5d78a6d23f0bd8138e3caa38ac0a5aad68719d03cf86dc0060","observation_id":"fd4f7cb2-84d9-42f7-9d58-9953771d356d","resolution":{"observed_at":"2026-08-06T21:12:04.301035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.282221Z","title":"Gcma: Generative cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"8bd1eab1-de4a-4895-9817-4c4dc6eb5210","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.481152Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:042e688b25b219d4d3b6e8664f1992703204c1050b7d030130c27d8735422636","observation_id":"7be22a30-c6aa-42a1-8f01-36546015233d","resolution":{"observed_at":"2026-08-06T21:12:04.286592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:12:03.486303Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.486303Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:af5065acc1cb1d3b78ee490ba29420a11c987ed5af0fb6e84ee80095038d4006","observation_id":"3d11eb4b-aecf-4563-88a8-77e0ac458ce8","resolution":{"observed_at":"2026-08-06T21:12:03.486303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.267851Z","title":"Parseval networks: Improving robustness to adversarial examples","venue":null,"work_id":"549121ce-bda1-4b20-9177-bcd421785da6","year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.491971Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:44fe1e1e7150c9a0ef6272d0436b15da1e0653fffff7fb1ef683353522504da7","observation_id":"f7554876-00cb-4579-a646-9fbd67b13ab0","resolution":{"observed_at":"2026-08-06T21:12:04.272326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.496616Z","title":"One perturbation is enough: On generating universal adversarial perturbations against vision- language pre-training models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.496616Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:1e7efbf46e22e50e71a81ae450f744b081ebe3982affcb7cfa5423cab0c6502d","observation_id":"128bc05e-11e6-426c-8930-b4fd367ac9cc","resolution":{"observed_at":"2026-08-06T21:12:03.496616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.500911Z","title":"Mmbench-video: A long-form multi-shot benchmark for holistic video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.500911Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:338a93e62ccc9d7a55f96bf416ad847b6e54b16ef1f8abb2b0bb6f87e1573b38","observation_id":"8b69b999-4419-4bb0-b762-2b015be3263a","resolution":{"observed_at":"2026-08-06T21:12:03.500911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-06T21:12:03.505036Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.505036Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:917d71a9ccc89ba4d6864f2ab3872d51f8c55cc3c2df138842dfb7e3c4b0c5f9","observation_id":"3081277c-1838-442e-8114-028a50bc5332","resolution":{"observed_at":"2026-08-06T21:12:03.505036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.241890Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"836e81a4-bd18-4575-9887-52c0088b29d7","year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.509895Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:bb5f83fdaaea6b93d6eadf8e85a05a35a1350753bd2798b3657a385558e3244a","observation_id":"f83f7fd2-5384-4c96-bf26-f92b75ca8ffc","resolution":{"observed_at":"2026-08-06T21:12:04.246709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.225757Z","title":"Retome-va: Recursive token merging for video diffusion-based unrestricted adversarial attack","venue":null,"work_id":"306d2ea7-3fcb-46d3-aa23-3bb6ae59cc20","year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.515186Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:34239db4b1ae85e64566bd1f6632780faf0e254cb76223c3deabff9655693ce8","observation_id":"40c594a2-e467-4b93-967c-63785b6c8830","resolution":{"observed_at":"2026-08-06T21:12:04.230595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-06T21:12:03.519327Z","title":"Explaining and harnessing adversar- ial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.519327Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:dbb5758ad590ed40d2d18c0afdba005c289d087e1a34fa022ec7c34baf384bf8","observation_id":"82d0fffc-fb17-46c4-b2ae-dc9427800d6d","resolution":{"observed_at":"2026-08-06T21:12:03.519327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.210014Z","title":"X-transfer attacks: Towards super transferable adversarial attacks on clip","venue":null,"work_id":"10c7170b-1725-40da-b889-e07f7be90ee3","year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.523977Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:04869d16db962df716bc32631fd8def576ba251158ee4871de2fe2b10139ec8e","observation_id":"48a29949-3fa6-4845-b58a-894c68812495","resolution":{"observed_at":"2026-08-06T21:12:04.215116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:12:03.528213Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.528213Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:9e312aa3608b232f18edd3d07df92432e54877b5b56d18657853dc57a8c6fbac","observation_id":"4c32859d-f05e-4ad6-94f8-674b6719cd98","resolution":{"observed_at":"2026-08-06T21:12:03.528213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:12:03.532425Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.532425Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:aa45d0d70476fbb4601955662412d79f0724fa910912d1785cbc4b074a325a72","observation_id":"eead32a8-c627-48ac-b545-2cbbaea125dc","resolution":{"observed_at":"2026-08-06T21:12:03.532425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.536504Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.536504Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:a208927356a1710b3adec2427422c574cf88157ee0333b4655aec556b7f0fc77","observation_id":"ebd10513-2b87-41c1-99b6-38a145df829f","resolution":{"observed_at":"2026-08-06T21:12:03.536504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.540655Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.540655Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:723b9d68588cbb63ef0816a8139ceb84f853acc22a0e65130701be6bf80b92f6","observation_id":"51a9d344-5cb7-440f-ac7d-d88c4ffc0315","resolution":{"observed_at":"2026-08-06T21:12:03.540655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.174046Z","title":"Set-level guidance attack: Boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"e2d4062f-8386-4f36-a29d-0b9fd9c272d6","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.544625Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:5143ac373026796f989f5fee8f945e909a85a755f00e76b9e199ef473f585f8b","observation_id":"a3ea58a3-74c1-4ee8-83a9-81ddaf24e3de","resolution":{"observed_at":"2026-08-06T21:12:04.179120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-06T21:12:03.549503Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.549503Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:b7cd2c208287fdeaea6576e5818ef04b0179eb97335a82ed69b4f5c905929ee6","observation_id":"b6a1ca85-0bdb-487b-98a7-73c187545f8e","resolution":{"observed_at":"2026-08-06T21:12:03.549503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.159247Z","title":"Univer- sal adversarial perturbations","venue":null,"work_id":"4b9fd1e9-95a6-4e14-8db9-6c3655970d7a","year":2017},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.554064Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:09a811f81a8ef99323dce820a93b7426e9bc91027e4ea74ea7ae78e6e28dd1b1","observation_id":"93f61dd9-ccb2-44ed-815b-7fdc3892785b","resolution":{"observed_at":"2026-08-06T21:12:04.163647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.558815Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.558815Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:62fe433dbe0bfd9e3c0f5c9f5592348183a91668d25ae3f55beef32e936cda63","observation_id":"ab3872f9-c4e8-4123-859f-9d5a7f70b926","resolution":{"observed_at":"2026-08-06T21:12:03.558815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.563178Z","title":"U-net: Convolutional networks for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.563178Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:b1b7e4aacb7e63f938cd94ffc327be4a559e1f87e22ae96987088ffdfbe6cd6d","observation_id":"7c9e3e32-446e-4b8d-a0f7-e5a836791a7f","resolution":{"observed_at":"2026-08-06T21:12:03.563178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.567331Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.567331Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:fe0c4c8df755779d1f8f114b52a6587fd93df6c46e0505d366540bd147d083c9","observation_id":"47612cf9-a8db-4d85-a995-80f50e49d618","resolution":{"observed_at":"2026-08-06T21:12:03.567331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T21:12:03.571419Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.571419Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:f94aecdfc178e7537b6e0c2f04a4f0651b0b3657b7fd4ddd3b0599209f1a57cb","observation_id":"7a0c61b1-3f95-425e-b8ce-27c69effc377","resolution":{"observed_at":"2026-08-06T21:12:03.571419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T21:12:03.575394Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.575394Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:21427cad54895f1e37b0980936e27d35592e41d0dfeb8621f4d0aee519b63486","observation_id":"cc980697-0bdf-4e78-936d-0e3f2ad73a81","resolution":{"observed_at":"2026-08-06T21:12:03.575394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.112859Z","title":"Heuristic black-box adversarial attacks on video recognition models","venue":null,"work_id":"b7b72c00-153b-46cd-aa5b-8626bdd8978c","year":2020},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.579468Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:1ba4993f65f3251395b900da537b8c01702aee075cf521a76b1dc921a3ff5927","observation_id":"77b55267-56ec-4a69-a202-3b0d4b9db60d","resolution":{"observed_at":"2026-08-06T21:12:04.117058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.096063Z","title":"Boosting the transferability of video adversarial examples via temporal translation","venue":null,"work_id":"57920b5b-fe1b-43ba-bcbd-2e6a50ee641c","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.583937Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:6d5449564d4c335f83357ebc1aba13b68e3453df15f81cd2f2b90641e1e02232","observation_id":"90334929-223c-417a-ab9e-70774e542d45","resolution":{"observed_at":"2026-08-06T21:12:04.101434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.080050Z","title":"Cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"6ef04030-6378-40be-8f30-11b1d83f86d0","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.587903Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:673474dd2f3e25d0dda6178c0e0862a785185dbac375c8b298adca7b4e39bb83","observation_id":"c90db321-d442-49cc-a7b6-74635529a31c","resolution":{"observed_at":"2026-08-06T21:12:04.084862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.064957Z","title":"Adaptive temporal grouping for black-box adversarial attacks on videos","venue":null,"work_id":"a187f09e-2a00-4c55-ae46-3986ef58434d","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.592180Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:b68ff1715327743272519ad7d60e5f7704264fbd6b35241fa31531f4eea01bac","observation_id":"11506826-ea51-45e5-baa0-929ff5c98432","resolution":{"observed_at":"2026-08-06T21:12:04.069512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.049240Z","title":"Adaptive cross-modal transferable adversarial attacks from images to videos","venue":null,"work_id":"38456efb-48f6-48e5-8414-e2ca477c1384","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.596832Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:053b35ce1304b9b98346668c3aca227fc2ec2d8fe4cab11c64b697b8ec7fe703","observation_id":"63950faf-6718-4384-b2d9-e190306a711b","resolution":{"observed_at":"2026-08-06T21:12:04.054373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T21:12:03.601085Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.601085Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:6b1beeb0de9b8fb4a67b0db8345af4b97966e2995f74d97be03dc6cefd441c38","observation_id":"ef1ee7dd-1f2b-495d-9dc3-6daabfc7e3d5","resolution":{"observed_at":"2026-08-06T21:12:03.601085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.032954Z","title":"Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":"866a5b35-5fb8-4baa-a022-caf9cad56ea0","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.605433Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:6eab564864c907fdf7c919a69c72aefc70dd45158451c8b8ee78e48f31ea6674","observation_id":"d2c84931-efae-493e-b958-0a6fe724b5f0","resolution":{"observed_at":"2026-08-06T21:12:04.038244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T21:12:03.609942Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.609942Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:58d34d22e51b95f3bdb5a2760108873a29128e44e84575de4bc161274ed5728d","observation_id":"cafb8a2f-740b-498a-8a6a-66360466bc4d","resolution":{"observed_at":"2026-08-06T21:12:03.609942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:04.016837Z","title":"Towards adversarial attack on vision-language pre- training models","venue":null,"work_id":"3d9fec20-8c75-4284-905f-042ecbf1ecc3","year":2022},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.614224Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:1343c67b81524206d20c33a5b2b7ac7ea735b77d85c642c5be79ae93fd2969bb","observation_id":"a12e187f-292a-4365-a725-f186be113542","resolution":{"observed_at":"2026-08-06T21:12:04.021487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.618948Z","title":"Anyattack: Towards large-scale self-supervised adversarial attacks on vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.618948Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:3dd902c5d052ff965c99824424a6b6a1ed9ebe6ab32e3e7afc2d7cc759394692","observation_id":"3917b869-8038-4e06-92c5-d231c4ea92f5","resolution":{"observed_at":"2026-08-06T21:12:03.618948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-06T21:12:03.623119Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.623119Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:1c28aa39c33c69de2d939f7aa06adeb165026d5af04af4011531deeca5b2f55d","observation_id":"b3f8ab5d-e1e0-4dc3-a967-4662dd2d825b","resolution":{"observed_at":"2026-08-06T21:12:03.623119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.980753Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"adfbdbe0-7fa0-4235-b297-7d2261805544","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.627271Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:0e434a95afe887826e91515823631b858d2924293c2619020a5ed27301cdcc13","observation_id":"0dcb5446-bb7b-470d-9d49-d67f429a301d","resolution":{"observed_at":"2026-08-06T21:12:03.985237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:12:03.962555Z","title":"Advclip: Downstream-agnostic adversarial examples in multimodal contrastive learning","venue":null,"work_id":"5b20f619-2cb3-4a70-bcfb-b1a90b67b3b6","year":2023},"citing_paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:12:03.631575Z"},"links":{"citing_paper":"/paper/2507.00817"},"observation_digest":"sha256:de8ad0233b31dcaa47405548b145ced52b2e716c796c0a7a110e1a28ea968e08","observation_id":"79e3a4b7-3877-468d-9264-e3da8c4e4bf2","resolution":{"observed_at":"2026-08-06T21:12:03.968998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00817","last_updated":"2025-07-01T14:48:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:23:11.226777Z","submitted_at":"2025-07-01T14:48:27Z","title":"CAVALRY-V: A Large-Scale Generator Framework for Adversarial Attacks on Video MLLMs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.00817."}