{"as_of":"2026-08-10T12:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83834d56106618a341b81d333631cff4055b4f2c2440470181cd452d1d9dba92","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:40:49.610244Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:28:23.793963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T14:28:25.701065Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.05429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05429","snapshot_observed_at":"2026-08-06T14:28:25.701065Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","venue":"cs.CV","work_id":"a518c283-89a6-4a2f-b673-3fdcc667e465","year":2025},"citing_paper":{"arxiv_id":"2608.04885","last_updated":"2026-08-05T14:09:55Z","snapshot_observed_at":"2026-08-08T23:13:21.145558Z","submitted_at":"2026-08-05T14:09:55Z","title":"Evaluating the Diagnostic Robustness of Vision-Language Models Under Visual and Textual Perturbations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T14:28:23.793963Z"},"links":{"cited_paper":"/paper/2506.05429","citing_paper":"/paper/2608.04885"},"observation_digest":"sha256:6c4c51b54c7db7cb0c5b9808e78aed750aead71d9c7c752f832a799321eab62b","observation_id":"ffbaa1ea-698a-4b8d-9411-1e26d89989ee","resolution":{"observed_at":"2026-08-06T14:28:25.803833Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05429/citation-record","integrity":"/paper/2506.05429/integrity","json":"/paper/2506.05429/citation-record.json","paper":"/paper/2506.05429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.450292Z","title":"Advances in adversarial attacks and defenses in com- puter vision: A survey","venue":null,"work_id":"6cbd95a3-7aca-4749-b1f3-c0f619377b59","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.355753Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:049707af9167a262bad2c59d0b7291f0e1126243a4c1b815aee3291e763ba33a","observation_id":"5b569dc3-8a41-48d0-8a53-d040cac356dc","resolution":{"observed_at":"2026-08-07T10:40:50.456135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.435083Z","title":"Square attack: a query-efficient black-box adversarial attack via random search","venue":null,"work_id":"0c8b02d9-c0f5-4bc8-b443-cc7d0fb52221","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.362026Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a324d184423deb6b33320b42ed91d70d672f56d1c742ff68e43382de5f20ab12","observation_id":"d5e36efc-678e-4039-ab39-d2f006be3073","resolution":{"observed_at":"2026-08-07T10:40:50.440501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.418420Z","title":"A survey on adversarial attacks and defences","venue":null,"work_id":"10de632d-e69e-4fe4-99e6-6ef99369bc63","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.368675Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:b2a52578a6900d138c32afa1e97a071e980d4689920f60bd4c81319d3161dc80","observation_id":"7e22fc29-1fd9-40da-9946-71b0a6b19b94","resolution":{"observed_at":"2026-08-07T10:40:50.423975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.403371Z","title":"Textguise: Adaptive adversarial example attacks on text classification model","venue":null,"work_id":"4874fb6c-0b15-46f9-9a8e-a55eda8b5200","year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.374177Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:b6f8be014abf6e85cd94f385aa0a645363833b93a3a99ba69d239c6f442e11cf","observation_id":"99310f2d-5c31-4867-91d4-c709f0079e0b","resolution":{"observed_at":"2026-08-07T10:40:50.408333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.388909Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"4deff9e3-7b4e-4239-857c-e55d1a7157c1","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.380779Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:28d3b8813a25892917a9b888e8f492da5f211f4cad7306cd88014dbe36566962","observation_id":"e3384d94-2c18-4a75-846b-3e951464fb29","resolution":{"observed_at":"2026-08-07T10:40:50.393685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:40:49.386507Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.386507Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:cda17312abbf348fc3a2a524d49ad7a771daa71d3405cd97211f1cf99fae39ea","observation_id":"8a77fab5-a699-41ed-965e-18c4d01e4265","resolution":{"observed_at":"2026-08-07T10:40:49.386507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.373584Z","title":"Fda: Feature disruptive attack","venue":null,"work_id":"9122b5e0-b376-4093-8512-2b78ef279d2d","year":2019},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.392074Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a200ab84204ff07b1f64319d29ee6cac13e8da3ec476acd09beaeaf2fbbcdb8c","observation_id":"443e5018-ddd0-4d5b-a0ea-30c25dc409c3","resolution":{"observed_at":"2026-08-07T10:40:50.378219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.01970","last_updated":"2020-10-08T00:41:43Z","snapshot_observed_at":"2026-08-08T14:00:19.815816Z","submitted_at":"2020-04-04T16:25:48Z","title":"BAE: BERT-based Adversarial Examples for Text Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.01970","snapshot_observed_at":"2026-08-07T10:40:49.397598Z","title":"Bae: Bert-based adversarial examples for text classification","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.397598Z"},"links":{"cited_paper":"/paper/2004.01970","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:00bfcbb4ddfe7dc59eaa59e32c4a3439f2387da0ac8bf1bb64e6279a0c1371bb","observation_id":"7813e8be-082b-4816-b1a6-f0afd2f5bdf7","resolution":{"observed_at":"2026-08-07T10:40:49.397598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.358755Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"b937a17f-7f0e-47b9-a615-37a1adcfcbe9","year":2017},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.402837Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:0e43376d0b2b6bc0e693222373dcfb85e4ef61022abc181154e18fb3b2289989","observation_id":"1574f963-aa63-485f-86d3-978f90b78b8f","resolution":{"observed_at":"2026-08-07T10:40:50.363618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01610","last_updated":"2020-10-18T09:39:58Z","snapshot_observed_at":"2026-07-06T10:01:20.609728Z","submitted_at":"2020-10-04T15:54:03Z","title":"Adversarial Attack and Defense of Structured Prediction Models","version":2},"cited_work":{"arxiv_id":"2010.01610","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.01610","snapshot_observed_at":"2026-08-07T10:40:49.961262Z","title":"Adversarial Attack and Defense of Structured Prediction Models","venue":"cs.CL","work_id":"041443e5-e14c-4c81-9388-c341e6eef7dd","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.408180Z"},"links":{"cited_paper":"/paper/2010.01610","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:31bc084f70a777e4784ae03b0c647c02eae6cb19e2de947d6f3cbaebb2833b19","observation_id":"5d8fc5e9-149b-498d-b633-bf5933166c36","resolution":{"observed_at":"2026-08-07T10:40:49.967363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10013","last_updated":"2021-03-18T04:23:21Z","snapshot_observed_at":"2026-08-09T08:22:40.116436Z","submitted_at":"2021-03-18T04:23:21Z","title":"Model Extraction and Adversarial Transferability, Your BERT is Vulnerable!","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10013","snapshot_observed_at":"2026-08-07T10:40:49.413305Z","title":"Model extraction and adversarial transferability, your bert is vulnerable! arXiv preprint arXiv:2103.10013, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.413305Z"},"links":{"cited_paper":"/paper/2103.10013","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c7877e424536aeb3e17110fb546165d46b8be68ecacc45eab297d6a0623768fa","observation_id":"dabdfb06-0705-4516-9683-3d0d7b3895ae","resolution":{"observed_at":"2026-08-07T10:40:49.413305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.10579","last_updated":"2021-01-26T06:13:52Z","snapshot_observed_at":"2026-08-04T11:31:58.604518Z","submitted_at":"2021-01-26T06:13:52Z","title":"Generating Syntactically Controlled Paraphrases without Using Annotated Parallel Pairs","version":1},"cited_work":{"arxiv_id":"2101.10579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2101.10579","snapshot_observed_at":"2026-08-07T10:40:49.923030Z","title":"Generating Syntactically Controlled Paraphrases without Using Annotated Parallel Pairs","venue":"cs.CL","work_id":"60d718ac-5ab1-4d9b-9f32-96050a877772","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.418318Z"},"links":{"cited_paper":"/paper/2101.10579","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:bea23ace858183a4521dcd350b16da525f5c3f71e153e75fd5bd9d40b733d426","observation_id":"28df7976-4bfe-4047-8a3a-38930fb45386","resolution":{"observed_at":"2026-08-07T10:40:49.928498Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-07T10:40:49.423306Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.423306Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:1a1952366151c2bf9662993c51d10cf62db27fbadc5ff5309e43bb5c135d017b","observation_id":"702ffb37-ebe4-4cc0-94cd-57510549c0ff","resolution":{"observed_at":"2026-08-07T10:40:49.423306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.342805Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":"20a0f8d0-19f1-437a-997f-d013010b7141","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.430009Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:5f2ff0ae347a5f456978f87eadf303ae6149299516dacbdb8fe6705de2025e6e","observation_id":"91c0fb4d-7707-4bbd-aecb-d7d1c47102e4","resolution":{"observed_at":"2026-08-07T10:40:50.348436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.326240Z","title":"Adversarial deep learning: A survey on adversarial attacks and defense mech- anisms on image classification","venue":null,"work_id":"2d8e429d-0400-4e8e-a492-5f9d9555ddae","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.435519Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:4ef9b65e60fbdfba53d2df93044c36b4519c69c24883b0444e3c2ef17f4913c2","observation_id":"dcb91e86-a761-41d0-91d6-b325ed690eb4","resolution":{"observed_at":"2026-08-07T10:40:50.332145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.310424Z","title":"Vilt: Vision-and- language transformer without convolution or region supervi- sion","venue":null,"work_id":"27b3b70c-6d47-4170-938e-276eb222da79","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.440226Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a1089148bb59586037d62cea4cadad72c782db96afb1a0ea063ab6855010a25c","observation_id":"67f5a72e-63a8-4ecf-b471-ac9528398ef2","resolution":{"observed_at":"2026-08-07T10:40:50.315761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.07502","last_updated":"2021-03-15T04:56:31Z","snapshot_observed_at":"2026-07-06T09:56:03.214339Z","submitted_at":"2020-09-16T06:53:15Z","title":"Contextualized Perturbation for Textual Adversarial Attack","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.07502","snapshot_observed_at":"2026-08-07T10:40:49.444766Z","title":"Contextualized perturbation for textual adversarial attack","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.444766Z"},"links":{"cited_paper":"/paper/2009.07502","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:20091a210c0d2641f3515850818751f797c9d305981ed5765f25faf96def8a2a","observation_id":"c4a4c9fe-1914-41ae-ad4a-78b1e5c97543","resolution":{"observed_at":"2026-08-07T10:40:49.444766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09984","last_updated":"2020-10-02T03:08:04Z","snapshot_observed_at":"2026-08-09T12:20:45.396771Z","submitted_at":"2020-04-21T13:30:02Z","title":"BERT-ATTACK: Adversarial Attack Against BERT Using BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09984","snapshot_observed_at":"2026-08-07T10:40:49.449875Z","title":"Bert-attack: Adversarial attack against bert using bert","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.449875Z"},"links":{"cited_paper":"/paper/2004.09984","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:919bf7af3f9b55edb11dd644b75d1125d13fbf7f55eb7638ef7718304fe42a59","observation_id":"61645836-3be7-432c-a1d3-b5d61603a0d0","resolution":{"observed_at":"2026-08-07T10:40:49.449875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.11136","last_updated":"2021-05-25T08:24:19Z","snapshot_observed_at":"2026-07-06T11:12:04.788175Z","submitted_at":"2021-05-24T07:35:56Z","title":"Using Adversarial Attacks to Reveal the Statistical Bias in Machine Reading Comprehension Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.11136","snapshot_observed_at":"2026-08-07T10:40:49.454924Z","title":"Using adversarial attacks to reveal the statistical bias in machine reading comprehension models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.454924Z"},"links":{"cited_paper":"/paper/2105.11136","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2072dc3210a824a92e873adeb67c6b2099997fb939198fb9afe55560627be35b","observation_id":"0005a546-b9b5-4d12-90d1-c2c27a91e0d7","resolution":{"observed_at":"2026-08-07T10:40:49.454924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T10:40:49.459960Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.459960Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c1f4df2e6fd338af14bfe3b7f23120caad906603e102b1a20b92d6d248b174b9","observation_id":"a037c324-0687-46bc-b5b6-50c60817daf9","resolution":{"observed_at":"2026-08-07T10:40:49.459960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.294629Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":"32b8a70d-62ed-4746-9d8e-7e49bddd415f","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.464875Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a336e5c0eff6b45e54738012f6de718016a723c8801d62f651a1907f39e9c1d1","observation_id":"dabffa96-c21f-4730-8d11-5348bd73cf76","resolution":{"observed_at":"2026-08-07T10:40:50.299650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.279873Z","title":"Deepfool: a simple and accurate method to fool deep neural networks","venue":null,"work_id":"ef9375ac-c222-47ad-bb5e-bc3870db4aee","year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.469469Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:58a38103f7ab51b780292cc542b47e19cf9ae3efb0fd1091935ed2729a0005d0","observation_id":"8defe554-c510-4f30-a260-195b91340559","resolution":{"observed_at":"2026-08-07T10:40:50.284663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.264618Z","title":"A self-supervised approach for adversarial robustness","venue":null,"work_id":"6ebd2359-7e6d-400a-a1c7-03ba6fb2d12d","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.474120Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:7a1349fd20239fb1bb1c7ff501a2d3c9588a5b1fc48b2dd8849a3ea7d5f83550","observation_id":"d597ddd2-fddd-418d-884c-40f56852c692","resolution":{"observed_at":"2026-08-07T10:40:50.269469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.248329Z","title":"Crafting adversarial input sequences for recurrent neural net- works","venue":null,"work_id":"58cd138f-e24e-4a89-a8a1-43f741a19d08","year":2016},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.479099Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:4defff15c8a37d2cb224cc447bc770238de428f7fff120eb9126a3a4bfd4cc0d","observation_id":"3617bb40-c3d1-4291-aeb8-6b778f65ee26","resolution":{"observed_at":"2026-08-07T10:40:50.253644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.232867Z","title":"Measuring robustness with black-box adversarial attack using reinforcement learning","venue":null,"work_id":"96f18fac-1d5a-4c4b-998b-7b3a6ff2beab","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.483879Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:5b8ef6013edc91ffe717e7c3ee6def682e82f811772e301dfca2550d800db69f","observation_id":"832ec756-f042-4180-808b-efc0f84d2362","resolution":{"observed_at":"2026-08-07T10:40:50.237827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:49.488568Z","title":"Rl-cam: Visual explana- tions for convolutional networks using reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.488568Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:d64939006530d90e5583070f8f2ab7f1642fa5556f7cf8d678d5168d25cdd494","observation_id":"c8b6c48b-877f-4489-a355-2251c4d1dc3d","resolution":{"observed_at":"2026-08-07T10:40:49.488568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.202662Z","title":"Robustness with query- efficient adversarial attack using reinforcement learning","venue":null,"work_id":"d820f50a-6d45-4b67-8fbc-58c90d8ec334","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.493660Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:7213bf43aab63d4d43cd757552b7b2fbe0fb661811e3c3c82cbc488ae739d69a","observation_id":"432b199b-dcee-4ac0-9e85-d0ef9703e567","resolution":{"observed_at":"2026-08-07T10:40:50.207280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.187718Z","title":"Reinforcement learning based black-box adversarial attack for robustness improvement","venue":null,"work_id":"59707c18-5285-42bc-b0ff-dda959e3d6fe","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.498363Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:3c398440a2a23edc5870952c76c8afc3335692d07a765f3b4d9a19cf6afaa6dc","observation_id":"564b400a-e897-4123-a009-decc6ce6eb94","resolution":{"observed_at":"2026-08-07T10:40:50.192988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.171972Z","title":"Robustness with black-box adversarial attack using reinforce- ment learning","venue":null,"work_id":"c3aa3fdc-b0fa-4ccf-8776-3fdb7e2302f6","year":2023},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.503486Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:f7ed3d2561b51d713de4ebf1e66bdb948785727320417a69fe32db65bdb33aa9","observation_id":"a310cd5a-f58d-40b1-a555-864f2eddb475","resolution":{"observed_at":"2026-08-07T10:40:50.177399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.156638Z","title":"Benchmark generation framework with customizable distortions for image classifier robustness","venue":null,"work_id":"9659335b-e87d-4975-acbc-1e346cde7d4b","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.508711Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a8477c879228ecfa5d1c84e50119ea3e23f418ca207235a7fe991c325ef0da0f","observation_id":"d010a191-03f8-4571-8420-13dfbeeedfa1","resolution":{"observed_at":"2026-08-07T10:40:50.161654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.140316Z","title":"Robustness and visual explanation for black box image, video, and ecg signal classification with reinforcement learning","venue":null,"work_id":"7afd814b-afd5-43ce-8045-0334d787a8be","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.513208Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:adf01e5002844b20443cf15d6e4db530598df9de991ae6c17afeea745decb45a","observation_id":"458db8fb-ebe6-40e1-8eef-9b510c60f266","resolution":{"observed_at":"2026-08-07T10:40:50.145499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.122917Z","title":"Reinforcement learning platform for adversarial black- box attacks with custom distortion filters","venue":null,"work_id":"4b1af6ae-dd94-4b3a-a8fc-6a82589e21e0","year":2025},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.517863Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:8fb02a335a148416d65119cb5928bfeae3bf87633fd7de30a8afa66596c36793","observation_id":"ce97da1b-905e-4ba0-a033-23f0e821ac07","resolution":{"observed_at":"2026-08-07T10:40:50.128705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-07T10:40:49.523244Z","title":"A corpus for reasoning about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.523244Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:767eebebc050d9780b4f7670bead295ae21e940dca71b9e7b5403438ba2ad3f5","observation_id":"a283d790-865a-465f-b349-8c7f6727801c","resolution":{"observed_at":"2026-08-07T10:40:49.523244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04985","last_updated":"2020-02-27T22:07:11Z","snapshot_observed_at":"2026-07-06T09:03:46.923530Z","submitted_at":"2020-02-27T22:07:11Z","title":"Adv-BERT: BERT is not robust on misspellings! Generating nature adversarial samples on BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04985","snapshot_observed_at":"2026-08-07T10:40:49.529540Z","title":"Adv-bert: Bert is not robust on misspellings! generating nature adversarial samples on bert","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.529540Z"},"links":{"cited_paper":"/paper/2003.04985","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:36e8b953343a09b72659f7edcfe7ac4642da44d45279f51cdcc735f9be5bc141","observation_id":"a7efc97c-ebbd-4828-9943-b6dd509bf935","resolution":{"observed_at":"2026-08-07T10:40:49.529540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6199","last_updated":"2014-02-19T16:33:14Z","snapshot_observed_at":"2026-07-06T03:31:33.797310Z","submitted_at":"2013-12-21T03:36:08Z","title":"Intriguing properties of neural networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6199","snapshot_observed_at":"2026-08-07T10:40:49.534898Z","title":"Intriguing properties of neural networks","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.534898Z"},"links":{"cited_paper":"/paper/1312.6199","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:18dd7efef75afe9cb9fa72d64476577e15d732dd231bce9d9241864595c9954a","observation_id":"440d3c0c-67fd-4e2a-bb7f-11e5e06f3fad","resolution":{"observed_at":"2026-08-07T10:40:49.534898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.106938Z","title":"Autoattacker: A reinforcement learning approach for black- box adversarial attacks","venue":null,"work_id":"d33a2b5e-cb42-4db2-81ec-086883ab15a7","year":2019},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.539625Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:15887d1b75711b21f8ea5066fea42205ceb1ce7dce34b7beceb3355e4dc9fcf2","observation_id":"2942d313-f870-4612-88b7-92239c4ef58b","resolution":{"observed_at":"2026-08-07T10:40:50.111839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14100","snapshot_observed_at":"2026-08-07T10:40:49.544208Z","title":"Git: A generative image-to-text transformer for vision and language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.544208Z"},"links":{"cited_paper":"/paper/2205.14100","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:4c83695eff5189a1d4fe1188047c9935ac4d0482839e00e17577773078c70f62","observation_id":"ce50ea18-4424-4be7-b824-0fd9ed4e1f58","resolution":{"observed_at":"2026-08-07T10:40:49.544208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02338","last_updated":"2020-10-05T21:07:45Z","snapshot_observed_at":"2026-08-02T16:46:22.596583Z","submitted_at":"2020-10-05T21:07:45Z","title":"CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation","version":1},"cited_work":{"arxiv_id":"2010.02338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.02338","snapshot_observed_at":"2026-08-07T10:40:49.757006Z","title":"CAT-Gen: Improving Robustness in NLP Models via Controlled Adversarial Text Generation","venue":"cs.CL","work_id":"7c1038a7-a4af-4434-8938-9445ce80c1af","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.549106Z"},"links":{"cited_paper":"/paper/2010.02338","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:cf2d214a0dae12555e0fe07694676d7b7c09fd3d0541cf2f97cf67c126d2caba","observation_id":"7154e275-9040-4a28-ac29-18e7ee591dcf","resolution":{"observed_at":"2026-08-07T10:40:49.763265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.07285","last_updated":"2021-04-21T10:14:36Z","snapshot_observed_at":"2026-08-09T13:13:39.611454Z","submitted_at":"2019-02-12T02:42:54Z","title":"Towards a Robust Deep Neural Network in Texts: A Survey","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.07285","snapshot_observed_at":"2026-08-07T10:40:49.553681Z","title":"Towards a robust deep neural network in texts: A survey","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.553681Z"},"links":{"cited_paper":"/paper/1902.07285","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:53e152fdaed29b408468ecbaff62ac205bfb3c6d2c103c9496b8a88d7ac0389c","observation_id":"94407776-c898-4ffd-992f-22c739462512","resolution":{"observed_at":"2026-08-07T10:40:49.553681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08313","last_updated":"2022-05-09T21:36:47Z","snapshot_observed_at":"2026-08-09T15:34:04.375145Z","submitted_at":"2021-12-15T18:02:04Z","title":"Measure and Improve Robustness in NLP Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08313","snapshot_observed_at":"2026-08-07T10:40:49.559495Z","title":"Measure and improve robustness in nlp models: A survey","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.559495Z"},"links":{"cited_paper":"/paper/2112.08313","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:73caff95de16a06d6d9a573277a9829c230712ca3017ba81d4a1372201999ed1","observation_id":"e2800bca-5293-40f3-a564-438c7123ced4","resolution":{"observed_at":"2026-08-07T10:40:49.559495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.090010Z","title":"Adversarial attacks and defenses in images, graphs and text: A review","venue":null,"work_id":"859122e4-bfb8-421b-99b3-1279cfd6a0fa","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.564491Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:a50fe99189a7550b6fc53d418bedbc3eafad8c6e3001bb9b6d39a6a068bc3c60","observation_id":"87b0d916-9759-4574-a83c-e2be20ed4081","resolution":{"observed_at":"2026-08-07T10:40:50.095546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08453","last_updated":"2022-10-19T21:31:34Z","snapshot_observed_at":"2026-08-10T03:14:05.252653Z","submitted_at":"2021-04-17T05:21:35Z","title":"R&R: Metric-guided Adversarial Sentence Generation","version":3},"cited_work":{"arxiv_id":"2104.08453","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08453","snapshot_observed_at":"2026-08-07T10:40:49.701126Z","title":"R&R: Metric-guided Adversarial Sentence Generation","venue":"cs.CL","work_id":"fda7bfcf-e072-42ec-bc5e-443eb79e7d61","year":2021},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.569253Z"},"links":{"cited_paper":"/paper/2104.08453","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:c6adf1505b3cdecd853c22b1e602cb6e6b91c51c3375a0cad59b184bb2e30370","observation_id":"da3b8e3c-c324-42f7-a169-978c23826c09","resolution":{"observed_at":"2026-08-07T10:40:49.708501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.073252Z","title":"Natural attack for pre-trained models of code","venue":null,"work_id":"76580fbc-f0bd-42b9-a233-7ab2fa814cfc","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.574806Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:d00a796735702610c6308b5b4b9e68a38cf7c258b2aedf6c50c522be982efa9b","observation_id":"f6bad0c4-e62b-49f8-b5ef-c788044ece9a","resolution":{"observed_at":"2026-08-07T10:40:50.078175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.057682Z","title":"Texthoaxer: Budgeted hard-label adversarial attacks on text","venue":null,"work_id":"bbdb0b9e-ff13-49da-b118-24ac75f0a351","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.580523Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:31779f038728d1be64f4a787afa75aa93b24fe64936c9a5e6642a1798c541b8b","observation_id":"b293655f-ac96-44f4-8a49-c1f5b23f8d4b","resolution":{"observed_at":"2026-08-07T10:40:50.062586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04655","last_updated":"2024-02-05T19:33:53Z","snapshot_observed_at":"2026-08-08T07:01:42.941395Z","submitted_at":"2023-10-07T02:18:52Z","title":"VLATTACK: Multimodal Adversarial Attacks on Vision-Language Tasks via Pre-trained Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04655","snapshot_observed_at":"2026-08-07T10:40:49.586440Z","title":"Vlattack: Multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.586440Z"},"links":{"cited_paper":"/paper/2310.04655","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:e1cd13401ee518094020bddf3b87722bfa3d4fb4a4c21750498988d83f699503","observation_id":"822854fb-9404-499a-98e9-3e294edda496","resolution":{"observed_at":"2026-08-07T10:40:49.586440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.042375Z","title":"Towards adversarial at- tack on vision-language pre-training models","venue":null,"work_id":"45b071d2-d457-4f49-8d5d-fa9ecfaebffe","year":2022},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.591675Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:03662583cd499799927dce6ea93955d7d204f18d7eeed9157998ff5f9d82dff1","observation_id":"6c503f17-372a-435e-b7c6-d6e83489f1a8","resolution":{"observed_at":"2026-08-07T10:40:50.047585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-07T10:40:49.596096Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.596096Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:ca7eb9adbc775f2e5ffc400652f0f38d111f014979f7a29426f7f571991ebc42","observation_id":"0473d5c1-5c95-4baa-acf4-23caab34ef95","resolution":{"observed_at":"2026-08-07T10:40:49.596096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.027056Z","title":"Adversarial attacks on deep-learning models in nat- ural language processing: A survey","venue":null,"work_id":"86495609-00d1-49dc-b1e7-3af0f94bd3b7","year":2020},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.601063Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:25bb1a42d0d390678f83f24b17cc563aa77fd352cb2756be370f163df546abdf","observation_id":"c3a7d398-2124-4beb-b60b-668d4dbe07c8","resolution":{"observed_at":"2026-08-07T10:40:50.031996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:40:50.011375Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"30f44144-d514-4c11-8f04-4e45307cff6a","year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.605673Z"},"links":{"citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:3fd3dc66c61073c81cf5903c72092395c4927a3b3941bfdb8f9063153982cc6f","observation_id":"9b2af941-c6c7-4cc0-9de3-0f2e91ebb556","resolution":{"observed_at":"2026-08-07T10:40:50.016136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19287","last_updated":"2024-11-12T10:48:21Z","snapshot_observed_at":"2026-07-06T18:07:27.432252Z","submitted_at":"2024-04-30T06:34:21Z","title":"Revisiting the Adversarial Robustness of Vision Language Models: a Multimodal Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19287","snapshot_observed_at":"2026-08-07T10:40:49.610244Z","title":"Revisiting the adversarial robustness of vision lan- guage models: a multimodal perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:40:49.610244Z"},"links":{"cited_paper":"/paper/2404.19287","citing_paper":"/paper/2506.05429"},"observation_digest":"sha256:2ee37e4a08985c28174dc845c15ed5a0611b9ca4f627f0e07f4b5c76b1c26f06","observation_id":"48fb0b46-4211-47e3-ade7-8dedcfe9dfa8","resolution":{"observed_at":"2026-08-07T10:40:49.610244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05429","last_updated":"2025-06-05T08:09:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:11:05.357858Z","submitted_at":"2025-06-05T08:09:05Z","title":"Coordinated Robustness Evaluation Framework for Vision-Language Models"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":4,"verified_fuzzy":28},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 1 inbound Pith citation observation for arXiv:2506.05429."}