{"as_of":"2026-08-15T16:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:927ff9a99849a727f886469e980efadd5e674cd23469f52fdd6d9f3aef641047","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T10:56:49.365745Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T04:46:56.552601Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:54.631580Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"cited_work":{"arxiv_id":"2502.08079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08079","snapshot_observed_at":"2026-07-04T15:09:54.631580Z","title":"Zhang, G","venue":null,"work_id":"7ded35dc-9994-46a4-b622-9230ff2e69b6","year":2025},"citing_paper":{"arxiv_id":"2606.26199","last_updated":"2026-06-26T02:47:28Z","snapshot_observed_at":"2026-08-13T00:33:15.607177Z","submitted_at":"2026-06-24T16:23:10Z","title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-26T01:52:12.291420Z"},"links":{"cited_paper":"/paper/2502.08079","citing_paper":"/paper/2606.26199"},"observation_digest":"sha256:46b7a4655ef2574880c88ff5fbaf43dfc5799ce076d0554addded84633da1ac5","observation_id":"bba5a8e3-a9f4-4f1b-be03-28d2c46f2d24","resolution":{"observed_at":"2026-07-04T15:09:54.633145Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"cited_work":{"arxiv_id":"2502.08079","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08079","snapshot_observed_at":"2026-07-04T15:09:54.631580Z","title":"Zhang, G","venue":null,"work_id":"7ded35dc-9994-46a4-b622-9230ff2e69b6","year":2025},"citing_paper":{"arxiv_id":"2606.26199","last_updated":"2026-06-26T02:47:28Z","snapshot_observed_at":"2026-08-13T00:33:15.607177Z","submitted_at":"2026-06-24T16:23:10Z","title":"MIRAGE: Protecting against Malicious Image Editing via False Moderation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-29T04:46:56.552601Z"},"links":{"cited_paper":"/paper/2502.08079","citing_paper":"/paper/2606.26199"},"observation_digest":"sha256:7adc03bfba6b3c6564e08893b4a70d32d8a2c0688a6792af3fc9b0a35c7c4b37","observation_id":"6bcb7d15-d7b4-44d2-8247-8bed0bdeee45","resolution":{"observed_at":"2026-06-29T19:13:53.539382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08079/citation-record","integrity":"/paper/2502.08079/integrity","json":"/paper/2502.08079/citation-record.json","paper":"/paper/2502.08079"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.144767Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.144767Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:9a352d202bef8c7fa4239e92bbcf4ff2e32b87a27674b533cc2a2a8fb5015867","observation_id":"2848a6b5-2686-47f3-ad3e-61d93108a717","resolution":{"observed_at":"2026-08-08T10:56:49.144767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.094974Z","title":"Boosting adversarial attacks with momentum","venue":null,"work_id":"76240ba2-71d9-4eef-bd44-94d27ed86b4e","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.149865Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:aa2932e215ee5637303d04e28aa569fd90721fff7a5bc8af4f8786d38e10b8ec","observation_id":"76f46599-2a57-41ca-bd95-a020862e55f9","resolution":{"observed_at":"2026-08-08T10:56:50.099287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.082908Z","title":"Evading defenses to transferable adversarial examples by translation-invariant attacks","venue":null,"work_id":"808627c3-0f06-4422-a64f-c6e63f89d366","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.153482Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:7dfb72c6872b057e8cfcea1a3699da5d2275e0849cf0f5a89a317daa69cf6b7a","observation_id":"3edb9ccf-bf08-4d55-83a1-453dfe52578a","resolution":{"observed_at":"2026-08-08T10:56:50.086956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.070483Z","title":"An image is worth 16x16 words: transformers for image recognition at scale","venue":null,"work_id":"c0252d9d-861c-47e4-b193-6a48e604bb7b","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.156934Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:2a041c0da5aefb2442fd15291bde5e02bc918c8f2304c6bb575f511ca6e0ab8d","observation_id":"9d141539-66d4-401c-8c42-678e10a0322e","resolution":{"observed_at":"2026-08-08T10:56:50.074681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.058210Z","title":"Learning to learn transferable attack","venue":null,"work_id":"f4d85aa5-b4af-4fc2-a69c-ded085deda33","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.160519Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ad7245b593046999287dd2436f9bb2abaa7de301e7f0cf9cc158a9d86e7e3dd3","observation_id":"d5e299df-70ec-4438-b0f5-929f071f641e","resolution":{"observed_at":"2026-08-08T10:56:50.062432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.047851Z","title":"Fda: Feature disruptive attack","venue":null,"work_id":"852b3377-b50e-4715-9e9a-9c5605935967","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.164184Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a2519c40849c316b17b23c1eb513529951a02e736577c84f74daaca646a17475","observation_id":"36cd5bca-108d-4491-850f-53b6302c1030","resolution":{"observed_at":"2026-08-08T10:56:50.051470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.037132Z","title":"Boosting transferability in vision-language attacks via diversification along the intersection region of adversarial trajectory","venue":null,"work_id":"8b09d82a-3346-46a3-9ff5-611a1a6fd68c","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.167768Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:3d17b31cd53b2f16dc6041559d79aa769ae7bd5f835e570fd2298f9447420822","observation_id":"288e6807-85af-41c0-a910-1b0424aa098e","resolution":{"observed_at":"2026-08-08T10:56:50.040881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04913","last_updated":"2023-12-08T09:08:50Z","snapshot_observed_at":"2026-08-13T05:07:22.505099Z","submitted_at":"2023-12-08T09:08:50Z","title":"SA-Attack: Improving Adversarial Transferability of Vision-Language Pre-training Models via Self-Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04913","snapshot_observed_at":"2026-08-08T10:56:49.171617Z","title":"Sa-attack: improving adversarial transferability of vision-language pre-training models via self-augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.171617Z"},"links":{"cited_paper":"/paper/2312.04913","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:cd6cf616e596933a8203d9e6e421f1cfb5690627bfec0c1925f58da5f078305d","observation_id":"24c044c8-0174-49a2-9003-9321ec9c3ba3","resolution":{"observed_at":"2026-08-08T10:56:49.171617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.178806Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.178806Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:037f75de1edd1fa223ffc092aca3f8f051b06cf3bfac07ee1e72c0c9d6666b88","observation_id":"77f04d8d-c1b9-4a9a-b5b2-a3b4531b8e0c","resolution":{"observed_at":"2026-08-08T10:56:49.178806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.019516Z","title":"Natural adversarial examples","venue":null,"work_id":"ffe6b5d1-5de1-4295-abc4-5639153739f6","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.182988Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:4e2b3bc566c0824d1506de813c3005eab02da932f104f1441cbbf37d19875a72","observation_id":"9c5a7f62-3d21-4168-af6f-e7ec28333298","resolution":{"observed_at":"2026-08-08T10:56:50.023038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:50.009267Z","title":"Adversarial examples are not bugs, they are features","venue":null,"work_id":"cf55d28a-8ceb-47a0-95ae-17dbb4825d86","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.186596Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:813104abf44fba2044369825a5d9d94f5398852bfcd0e59304573b5bfacce85f","observation_id":"5687506a-7ff1-465e-80ed-32af63044224","resolution":{"observed_at":"2026-08-08T10:56:50.012858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.998531Z","title":"Transferable perturbations of deep feature distributions","venue":null,"work_id":"ce9b824d-56c7-4982-9abc-652d63038941","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.190201Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:9d28dccf7572efc4016185b8b1683e4d48a56da616831a3d2c5c5b5bcc3bf954","observation_id":"68ea14f5-97d5-4610-9d01-39bc5c29721e","resolution":{"observed_at":"2026-08-08T10:56:50.002161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.987646Z","title":"Adversarial example generation with syntactically controlled paraphrase networks","venue":null,"work_id":"59e663ba-03ad-4230-99ef-e21aa84ce891","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.193816Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:3052d1fd41e2cba40b635641615a24be27fa777da9be5f5f0490fe30b779352b","observation_id":"12e84fee-c2ff-4bb3-8560-c5ff50b30d21","resolution":{"observed_at":"2026-08-08T10:56:49.991529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.976905Z","title":"Is bert really robust? a strong baseline for natural language attack on text classification and entailment","venue":null,"work_id":"bb5432e6-c9e5-458d-aec9-060f802a5509","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.197464Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:475a578707dd37d508690f8816bd423298fa58eed7aefef59c1370984ad04c86","observation_id":"312c34c4-0b5b-4120-9b73-341d470be727","resolution":{"observed_at":"2026-08-08T10:56:49.980878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.966558Z","title":"Align before fuse: vision and language representation learning with momentum distillation","venue":null,"work_id":"4a80df8a-7f8b-46b3-bffb-cffe491ef2bf","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.201301Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:4ea5b900763bf052bc05d1da80861316900d1c6542e8f8ae5bfdd6113ec47cd6","observation_id":"55e61711-0a94-4f6f-b8d7-c31189dba137","resolution":{"observed_at":"2026-08-08T10:56:49.970142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.956110Z","title":"Blip: bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"9a0d6bff-fec0-4169-8fcf-99100e601b04","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.204924Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ed8f3e401f46855d4fdac302b546c65a92e92b41b19f380eb7446899e9617988","observation_id":"7f54841a-a7dd-4520-9282-d6993664ae9a","resolution":{"observed_at":"2026-08-08T10:56:49.959748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.945034Z","title":"Bert-attack: adversarial attack against bert using bert","venue":null,"work_id":"1a247ee2-dc85-41f5-9700-bcab9cd4f2d7","year":2020},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.208859Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:aac17a5c301ddc92d4dcaeb918b8887de4cb48aec85d751441142682bc4902b4","observation_id":"c6da15fc-6387-4357-96ab-0d3676caba3a","resolution":{"observed_at":"2026-08-08T10:56:49.948862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.934956Z","title":"Nesterov accelerated gradient and scale invariance for adversarial attacks","venue":null,"work_id":"ef6ab8cf-28ca-4d6b-9330-0f3e8b1f8377","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.212623Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f4313672755bf13dba56f903c58fc1b9b0caaa7512356cd97e2b50f66e3d4af8","observation_id":"b002cfa9-840a-4733-829a-0ace8b9445d9","resolution":{"observed_at":"2026-08-08T10:56:49.938578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.924112Z","title":"Microsoft coco: common objects in context","venue":null,"work_id":"d3faefdd-75cc-4d16-a4fa-66cf9995f712","year":2014},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.216344Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f952b2f6dd34d06071e5099b09412606e8d74b7938af0e896555d7cd7d9ac78f","observation_id":"96d0fde0-55d5-427e-ae05-dfda1b557751","resolution":{"observed_at":"2026-08-08T10:56:49.927870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.913352Z","title":"Delving into transferable adversarial examples and black-box attacks","venue":null,"work_id":"620a0ac2-e162-4e53-8949-bcec1f06fe24","year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.220185Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:12634d35be5ec9bded6417ddf686179f4d20f8b86c6f923102e55ef0b963808d","observation_id":"bafd4ac0-2912-40bb-8aa9-b61eeb839ada","resolution":{"observed_at":"2026-08-08T10:56:49.917282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.903218Z","title":"On the convergence of an adaptive momentum method for adversarial attacks","venue":null,"work_id":"f66f1a03-71ba-4be8-97f5-2230badf799a","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.223900Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:117c17a91a50eccd0f57de71ba703c8fa4571cdb00bd0a0802ee40a802ba6019","observation_id":"c7ed4afb-0228-4fd4-b9bf-fecdff89fe51","resolution":{"observed_at":"2026-08-08T10:56:49.906829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.891906Z","title":"Set-level guidance attack: boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"9fd9831c-e14c-4db1-82ac-3f962c7d0a3c","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.227524Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:53eb6e01411bcdaf0e7c55a5c11f9730f54049836b6e9871f113cd588afedff5","observation_id":"2775cb01-e92c-45b8-8866-48197dd8f866","resolution":{"observed_at":"2026-08-08T10:56:49.895976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.881424Z","title":"Towards deep learning models resistant to adversarial attacks","venue":null,"work_id":"155c7d6a-9c78-4a24-bd56-86f967dd400d","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.231249Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:75f2f24ca013fc0223dd64407134fe424dfe87db8581da629725094ec6f9159f","observation_id":"81c48614-8602-4201-9922-5568b37eb5b3","resolution":{"observed_at":"2026-08-08T10:56:49.885014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.871256Z","title":"Universal adversarial perturbations","venue":null,"work_id":"ae010ce9-1ba6-45e2-964e-440433548b87","year":2017},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.234966Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:6c9ad6c2957bc1dec111f6326fec7b9c33cdff29432a6b0a385445b1dabc63e4","observation_id":"fb12cd51-67f1-46e8-9db7-3cdead3ca969","resolution":{"observed_at":"2026-08-08T10:56:49.874609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.861346Z","title":"Stress test evaluation for natural language inference","venue":null,"work_id":"7096441a-e737-4430-bff6-6ff9dc161300","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.238884Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:b203cbf539d974ba4bb7c3a435de8c0a9f0c5fc7e128bc0edc0a99cda02ea524","observation_id":"3025e76c-7f95-483e-9469-4e98aad4bfa6","resolution":{"observed_at":"2026-08-08T10:56:49.864898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.851727Z","title":"Cross-domain transferability of adversarial perturbations","venue":null,"work_id":"26645bc0-285d-4ab5-8778-e656bc76c85d","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.242552Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:78e4ffb93b023b3072ae75608b7a26eba99a6c3f26dc50e666eb746001c56325","observation_id":"3405c873-a85c-4cde-b3a3-b079bb87c7b1","resolution":{"observed_at":"2026-08-08T10:56:49.855199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.841304Z","title":"Flickr30k entities: collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"ddf61e9e-b8bc-4c8d-89a3-fdfeded89e97","year":2015},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.246426Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:4c2a30651f7cecb94036b3a98b4787cf3d774859219dd72f128683772f13707d","observation_id":"cb289f9d-d767-47b5-a6f3-8ee47f037b98","resolution":{"observed_at":"2026-08-08T10:56:49.845430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.830589Z","title":"Generative adversarial perturbations","venue":null,"work_id":"eced1c65-10f0-47df-ac2b-8c62e8951083","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.250073Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:63427e87dc4369f4b65a147dae264de11fb44e073e595166b564913f06777082","observation_id":"4085db41-a8eb-4c4e-b4c2-4bea601d55bd","resolution":{"observed_at":"2026-08-08T10:56:49.834367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.819313Z","title":"Understanding and improving robustness of vision transformers through patch-based negative augmentation","venue":null,"work_id":"36ac83f8-4684-4e7e-8368-271f8c1c0531","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.253570Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:36aebfa7980d016b8d09f49bbcd7f40e6afa623c1672fd77a87291492794672f","observation_id":"5f0dcf48-10b8-4ac6-9699-b9382ae7a729","resolution":{"observed_at":"2026-08-08T10:56:49.823406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.809150Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a8e4fa27-6de7-46ab-9b19-22f0fecd8bac","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.256879Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:79430eb031e4341299b30b552a9b0d0ea6b2bfe031502f9fc1d96cffe80f0d91","observation_id":"d4be6507-252e-4405-98c6-e8350b275e75","resolution":{"observed_at":"2026-08-08T10:56:49.812991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.799308Z","title":"Generating natural language adversarial examples through probability weighted word saliency","venue":null,"work_id":"901fd0ab-ccc0-488d-bb94-817a6b551bf5","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.260070Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:79456132e70ca277d1009034cf19ea0044dedce4deef4d1f2d898da0044ab221","observation_id":"8f8fd580-1f33-4bfc-8a26-56f4e252420e","resolution":{"observed_at":"2026-08-08T10:56:49.803054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.789074Z","title":"Grad-cam: visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"a15365f1-7ea0-46bf-9bfb-ecb7a844ffb7","year":2017},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.263253Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:8a1731a9364a240351dd8671ef1d12055a0fe097e3af091dbca9180caea0baaf","observation_id":"bd1b5807-5191-4beb-be5e-f9a78cdd4fef","resolution":{"observed_at":"2026-08-08T10:56:49.792921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.778297Z","title":"Intriguing properties of neural networks","venue":null,"work_id":"6397cd83-62b3-422e-a569-2745dc583d6c","year":2014},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.266705Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:46694f672c070febf3bc7803e99138b2a20f2e4936da44556713b8b809fe9c2d","observation_id":"c4439e56-3763-4940-a524-df6aa052b7f8","resolution":{"observed_at":"2026-08-08T10:56:49.781913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T10:56:49.270016Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.270016Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:e019c1a4ad5fc5344f2bfb05e8515400773a10aac555a34bac0e5274256c6d4e","observation_id":"99c6b732-090c-4084-b246-8f5da860144b","resolution":{"observed_at":"2026-08-08T10:56:49.270016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.768194Z","title":"Boosting adversarial transferability by block shuffle and rotation","venue":null,"work_id":"f34dbc34-7b97-408c-93c6-0c5e28c9a573","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.273636Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:45abd3803bde4499e3fb5f1f6aaa513131365cf10996450a9ba39649e4018521","observation_id":"0d3b3747-ed78-406a-9fd0-566f9406bb24","resolution":{"observed_at":"2026-08-08T10:56:49.771753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.757905Z","title":"Admix: enhancing the transferability of adversarial attacks","venue":null,"work_id":"500bebc5-ba08-4628-8d6e-b69b362a4bf8","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.277115Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f30cc6ab9cab88f4ebc9594f8ccfd249b8cedf467461a5728a80a82f066430f2","observation_id":"96a9a253-6bc9-4c96-aa3a-e1499b4b2917","resolution":{"observed_at":"2026-08-08T10:56:49.761626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.747931Z","title":"Structure invariant transformation for better adversarial transferability","venue":null,"work_id":"e791a86c-319c-4b2d-b7d4-5dcf2fece94b","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.281062Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:6b12debd42e647e7337ca46692a976f414ee9c0c3d01e03317e86194365725a2","observation_id":"f5d7deaa-4086-4c1a-b6a6-f07606e4263c","resolution":{"observed_at":"2026-08-08T10:56:49.751441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.737904Z","title":"Prototype-supervised adversarial network for targeted attack of deep hashing","venue":null,"work_id":"26a6200d-197b-49ab-983b-d1f6b78ccbe9","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.284908Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:e8742c3240843cc7d8514326ea92fbbbd16d819379c3041085214f274bb82542","observation_id":"6aa0cbd8-4caa-4d11-b329-16a74158483d","resolution":{"observed_at":"2026-08-08T10:56:49.741500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.727873Z","title":"Enhancing the self-universality for transferable targeted attacks","venue":null,"work_id":"42bf35f9-0b33-41e6-a5ae-b187867b0964","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.288931Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a7d65800bfdf21469152e0aadb71c0856531f52736c2a2b092d30336d513c6b1","observation_id":"f6dbda94-6773-481f-bdc3-e92eb54b30bd","resolution":{"observed_at":"2026-08-08T10:56:49.731545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.717831Z","title":"Improving transferability of adversarial examples with input diversity","venue":null,"work_id":"cea0cde4-be73-48e6-ac2b-c63bc4070eb9","year":2019},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.293250Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:d12983dc5ab0450ea3565cd87b1f91dac3048c10c5d361b54db0beadf969bbfd","observation_id":"fda6f140-8c2e-4852-b375-094502d72b81","resolution":{"observed_at":"2026-08-08T10:56:49.721517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.707251Z","title":"Stochastic variance reduced ensemble adversarial attack for boosting the adversarial transferability","venue":null,"work_id":"18919565-dbae-4d6c-8458-a6f73db40db8","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.297758Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:207a90ac7da5e2ec96caf7c25a51976bf418fd13601fcae0a7dbe8f8198ca101","observation_id":"5e71f3d3-3b59-457b-967e-1be82a75409c","resolution":{"observed_at":"2026-08-08T10:56:49.711242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.696822Z","title":"Fooling vision and language models despite localization and attention mechanism","venue":null,"work_id":"28f67bf9-54a8-4e1f-b7c6-f3bd2fe15b34","year":2018},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.301868Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:eca6112a52d0d2833eab7ae1e1d533620863b11fb240aae0bc1984088eae4ddc","observation_id":"ecaaa87b-9ffa-4209-9822-279fc5beb2d9","resolution":{"observed_at":"2026-08-08T10:56:49.700452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.686670Z","title":"Vision-language pre-training with triple contrastive learning","venue":null,"work_id":"ba5ffb8c-f38c-4148-a565-6bba1a3d4491","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.305951Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:215eb540f0e73635417d1430fa23e80bab234695f2720d144664c4b303abf62a","observation_id":"888fc5f3-6fb5-42b2-b3d7-5ee2e8dc7c6c","resolution":{"observed_at":"2026-08-08T10:56:49.690292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.675166Z","title":"Vlattack: multimodal adversarial attacks on vision-language tasks via pre-trained models","venue":null,"work_id":"67f0fede-7866-4420-829d-69ee60707be5","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.310171Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:6557380ac25240d1fa473acff83f0f46bdefd5f2729750293b41578259560622","observation_id":"c2dfbaf8-318c-4e0f-b4aa-67d4b4a51b9c","resolution":{"observed_at":"2026-08-08T10:56:49.678987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.663962Z","title":"Modeling context in referring expressions","venue":null,"work_id":"d6801aba-7f93-4ccf-b199-320cd104ec93","year":2016},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.314387Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:6eb62e0470bd56aa9a741abea7cbd2e5d984b0156409dc494b6cfe4b2ce7eee5","observation_id":"edf623ac-c007-4737-944f-190f137a897b","resolution":{"observed_at":"2026-08-08T10:56:49.667614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.653633Z","title":"Towards adversarial attack on vision-language pre-training models","venue":null,"work_id":"11157f0a-f019-4b2e-be2a-c175453bf41f","year":2022},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.318253Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:a0fca632eda1bb97945a889c21c5e4ea95bda84fa7f83a79226afdbce36b2535","observation_id":"5741ff4e-e0cb-4eab-90a1-71231416a415","resolution":{"observed_at":"2026-08-08T10:56:49.657490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.640896Z","title":"A survey on image perturbations for model robustness: Attacks and defenses","venue":null,"work_id":"db85db02-235f-4b4d-b29b-a60fc93ab79e","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.322097Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:89903a437d8aef434f24c5cb6ab84d4591798236995b6136c1680d2f92b2b93a","observation_id":"cb8b687b-c41a-4492-97b3-78c5506068f3","resolution":{"observed_at":"2026-08-08T10:56:49.645257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.628382Z","title":"Privacy protection in deep multi-modal retrieval","venue":null,"work_id":"5f584f73-e334-4b8b-955b-6409c86afc4f","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.326098Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:37543a64a1b137955ced09bb9f72e021d2d5812f0a0bf787ddc394fdb7c0a86e","observation_id":"f07c36e4-e152-4c8c-b78b-ac0dca51c499","resolution":{"observed_at":"2026-08-08T10:56:49.632590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.616065Z","title":"Proactive privacy-preserving learning for cross-modal retrieval","venue":null,"work_id":"ae9201b7-6412-42dc-8250-a729ff0cc545","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.329990Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:7891b59e6c0d1fc204188992be81871e71ed6a617ffa13b96894ac83104c2cec","observation_id":"9b302deb-489f-498b-8e52-090aacccef3a","resolution":{"observed_at":"2026-08-08T10:56:49.619918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.604324Z","title":"Universal adversarial perturbations for vision-language pre-trained models","venue":null,"work_id":"874ecac8-7326-40c0-984f-098017e8fc40","year":2024},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.334234Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:ef14160ba97fdf61dea0bc485ebf0f3e1202d8b6bd74b9a3fd1717b57470ee95","observation_id":"8a5a04e2-34a2-4d74-a815-8a09114ab739","resolution":{"observed_at":"2026-08-08T10:56:49.607854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.593299Z","title":"Adversarial robustness through the lens of causality","venue":null,"work_id":"b6730feb-0f04-4a3e-b190-7a2829ec3863","year":2021},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.338614Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f49aadc6404b97eebc8e72eb207a5852a283f5319325e4fa6f6e713d41575d83","observation_id":"76631142-aaed-4cdb-94b7-66bc0c74de0f","resolution":{"observed_at":"2026-08-08T10:56:49.597241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.581076Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"f35ac53e-9167-4489-a78a-270ce1378da5","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.343173Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:88976e2de1c868a92ec58e9aad303f5d979a2a81f3a98e5c721e7a72be623587","observation_id":"cc264f0a-8933-4f94-8e33-f196550a1a5e","resolution":{"observed_at":"2026-08-08T10:56:49.585539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T10:56:49.347950Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.347950Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:178c2bd39002c550be1c6b0a258dd1e257e699f9789f32e2caa6157f2f88fca9","observation_id":"fbc2d895-c296-4e22-a100-2e5f2d1a991c","resolution":{"observed_at":"2026-08-08T10:56:49.347950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.569021Z","title":"Efficient query-based black-box attack against cross-modal hashing retrieval","venue":null,"work_id":"9d4d44f7-0e90-44f5-98e3-02ac01ac0dea","year":2023},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.352420Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:deb07e3d7f614d57c28c42dfb1a06563ed8d9773c204326b1a01b098443f5acd","observation_id":"673301c2-5dba-4ba0-a2f9-88789fb754b6","resolution":{"observed_at":"2026-08-08T10:56:49.572974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.356705Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.356705Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:5014f6c5dba7416f05052fcbea0ec6525ffa1185279ceaf07ec3dbef39265f3d","observation_id":"15c5ac08-355d-4e85-870c-cd0bfcb83864","resolution":{"observed_at":"2026-08-08T10:56:49.356705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.361124Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.361124Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:f60685c93cc4ecc92e5d1c92b95882e5f73ad7d1f4b62f5b4ae0676d0842a15b","observation_id":"53e65c87-201d-4ac7-9b45-ebd2575f6f8c","resolution":{"observed_at":"2026-08-08T10:56:49.361124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T10:56:49.540465Z","title":"X\"bDls= L9 l֡33*!ںj@vp?3m endstream endobj 26 0 obj << /Filter /FlateDecode /Length 249 >> stream xMQI 0 @!^CC 9 X 1 ,=!s7 ٻYz","venue":null,"work_id":"7e8b2c80-cba2-4cfd-be39-670fe905eac5","year":null},"citing_paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T10:56:49.365745Z"},"links":{"citing_paper":"/paper/2502.08079"},"observation_digest":"sha256:d4584f9a62ac1f3aac8c8e487c3069c00a3fce7765766f47a51b046ed0b38d94","observation_id":"6ee93ebd-370d-4942-9946-b4ea05a46028","resolution":{"observed_at":"2026-08-08T10:56:49.546357Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08079","last_updated":"2025-03-03T01:35:58Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:21:45.753878Z","submitted_at":"2025-02-12T02:53:27Z","title":"MAA: Meticulous Adversarial Attack against Vision-Language Pre-trained Models"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2502.08079."}