{"as_of":"2026-08-12T22:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e64285e33b81581f0bd54aaa034e93409980487337e69abb165747a9c5247435","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:48:46.283268Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:24:49.439929Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T09:28:10.399987Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00114","snapshot_observed_at":"2026-08-11T18:24:49.439929Z","title":"Scenetap: Scene-coherent ty- pographic adversarial planner against vision-language models in real-world environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08014","last_updated":"2025-03-11T07:15:54Z","snapshot_observed_at":"2026-08-12T13:55:24.305760Z","submitted_at":"2024-12-11T01:41:19Z","title":"MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T18:24:49.439929Z"},"links":{"cited_paper":"/paper/2412.00114","citing_paper":"/paper/2412.08014"},"observation_digest":"sha256:0979dad377831dd26266932938356c95988a135fd4d30f9f98c019c8b07390bd","observation_id":"90f37915-c44a-4850-a22b-07dd97cc1639","resolution":{"observed_at":"2026-08-11T18:24:49.439929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00114","snapshot_observed_at":"2026-08-11T13:52:06.423820Z","title":"Cheng, H., Xiao, E., Gu, J., Yang, L., Duan, J., Zhang, J., Cao, J., Xu, K., and Xu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.423820Z"},"links":{"cited_paper":"/paper/2412.00114","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:6f2a5e3635ecd65542dc141f6a41056a0b5073c05e048622a2021f2830ec1087","observation_id":"f6e69485-f1b8-4bfb-a5b2-c017f58bba82","resolution":{"observed_at":"2026-08-11T13:52:06.423820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"cited_work":{"arxiv_id":"2412.00114","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00114","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SceneTAP: Scene-coherent typographic adversarial planner against vision-language models in real-world environments","venue":null,"work_id":"55d9d1ba-95ce-4337-885a-d6b173bea09b","year":2024},"citing_paper":{"arxiv_id":"2604.25102","last_updated":"2026-04-28T01:21:47Z","snapshot_observed_at":"2026-07-06T23:11:02.043135Z","submitted_at":"2026-04-28T01:21:47Z","title":"One Perturbation, Two Failure Modes: Probing VLM Safety via Embedding-Guided Typographic Perturbations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T17:24:05.847988Z"},"links":{"cited_paper":"/paper/2412.00114","citing_paper":"/paper/2604.25102"},"observation_digest":"sha256:c6a29a0b09be9ba5179fcf02af056a13600f7cdb4be81c9ee01775a951280d67","observation_id":"906c3d0e-f8b3-4f13-a6de-6af3f225549f","resolution":{"observed_at":"2026-05-11T23:21:15.033572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"cited_work":{"arxiv_id":"2412.00114","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00114","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SceneTAP: Scene-coherent typographic adversarial planner against vision-language models in real-world environments","venue":null,"work_id":"55d9d1ba-95ce-4337-885a-d6b173bea09b","year":2024},"citing_paper":{"arxiv_id":"2605.18593","last_updated":"2026-05-18T16:06:29Z","snapshot_observed_at":"2026-08-02T12:35:43.335194Z","submitted_at":"2026-05-18T16:06:29Z","title":"Not What You Asked For: Typographic Attacks in Household Robot Manipulation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T09:26:39.444806Z"},"links":{"cited_paper":"/paper/2412.00114","citing_paper":"/paper/2605.18593"},"observation_digest":"sha256:42fc293de142344c887d1108cfc410033b1de2153a4a9f3ed3a22a46f3bf11c1","observation_id":"82290c1d-6857-4760-b304-ac8dc1d4b0fc","resolution":{"observed_at":"2026-05-20T09:28:10.401596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00114/citation-record","integrity":"/paper/2412.00114/integrity","json":"/paper/2412.00114/citation-record.json","paper":"/paper/2412.00114"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.507928Z","title":"Un- veiling typographic deceptions: Insights of the typographic vulnerability in large vision-language model.arXiv","venue":null,"work_id":"ac86d408-8f69-4bca-959b-a3eff75c9673","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.876264Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:bc69b24c11d3d97d4e02f2173ce5ef1199f3d3f907245d4a69f28abfe18ee211","observation_id":"959f4d25-889c-4b7e-8222-165a1f45a24e","resolution":{"observed_at":"2026-08-12T10:48:48.512263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00626","last_updated":"2025-02-13T03:11:20Z","snapshot_observed_at":"2026-08-10T21:35:22.483372Z","submitted_at":"2024-02-01T14:41:20Z","title":"Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00626","snapshot_observed_at":"2026-08-12T10:48:44.941580Z","title":"Vision-llms can fool themselves with self-generated typographic attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.941580Z"},"links":{"cited_paper":"/paper/2402.00626","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:3ca02f71ae43734abfc124fce73a32795a9a6d8414a2246a1a4c9d5b074ab17b","observation_id":"42e7d51d-2a0b-47b5-a97f-57815e83a9dc","resolution":{"observed_at":"2026-08-12T10:48:44.941580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:44.946224Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.946224Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:9b3b791650799cb4ddf56fa97c260987ccc2685853f58d9c88e8be8753701d50","observation_id":"93cd3123-85b5-4ec7-aff2-0fd7fc026c59","resolution":{"observed_at":"2026-08-12T10:48:44.946224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:44.950726Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.950726Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:d9826346752b4f6bc2a487dae26a0c4f4fcc5d793d3a806b68551c2711928fa7","observation_id":"1c5de27f-7e44-42aa-8475-5cb864f2e4c0","resolution":{"observed_at":"2026-08-12T10:48:44.950726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:44.954832Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.954832Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:e08827fe6a17df94f8231bc87cfc92b176ad00410dd2564540ab170e0e452acc","observation_id":"dd7e1a67-32cb-4e9e-8dac-39c719987036","resolution":{"observed_at":"2026-08-12T10:48:44.954832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06083","last_updated":"2019-09-04T18:53:10Z","snapshot_observed_at":"2026-08-07T14:27:46.872660Z","submitted_at":"2017-06-19T17:53:11Z","title":"Towards Deep Learning Models Resistant to Adversarial Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06083","snapshot_observed_at":"2026-08-12T10:48:44.958598Z","title":"Towards deep learn- ing models resistant to adversarial attacks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.958598Z"},"links":{"cited_paper":"/paper/1706.06083","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:f39b8a4dc6af7746efe4e174d2f2b33108a9581bcff3c749284ecddc6a80080a","observation_id":"09c59ec9-9fc4-4daf-b530-db04b9f84557","resolution":{"observed_at":"2026-08-12T10:48:44.958598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.477167Z","title":"Irad: implicit representation-driven image resampling against adversarial attacks","venue":null,"work_id":"e8e77061-bdbf-48c9-a424-908a4f218fcc","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.962914Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:4d80a2c52f54330153b332c7f4b3b34735e16227dac751735b0d23e93a86afcb","observation_id":"ce35016b-867c-45e8-851c-c68f624124e4","resolution":{"observed_at":"2026-08-12T10:48:48.481016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.464038Z","title":"Lrr: Language- driven resamplable continuous representation against adver- sarial tracking attacks","venue":null,"work_id":"88f6bec2-3026-4c32-a557-9485ec41bde6","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.966374Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:a90561dff0e0e1b7e3f0adc5f08920186f888b3a52d6b7b31faef760b0a1113a","observation_id":"2d383b11-c351-4d92-ba72-cd6e3a1d9365","resolution":{"observed_at":"2026-08-12T10:48:48.468554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16220","last_updated":"2023-05-25T16:28:30Z","snapshot_observed_at":"2026-08-10T19:32:43.339940Z","submitted_at":"2023-05-25T16:28:30Z","title":"On the Robustness of Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16220","snapshot_observed_at":"2026-08-12T10:48:44.970401Z","title":"On the robustness of segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:44.970401Z"},"links":{"cited_paper":"/paper/2305.16220","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:4286af1ba30e12f6e771a207978f89c264f32e573403519f86b9065e8b10b9f1","observation_id":"b78f2d46-0d51-47ef-9122-d9ed6bb4c198","resolution":{"observed_at":"2026-08-12T10:48:44.970401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.268953Z","title":"Adversarial relighting against face recognition","venue":null,"work_id":"bae89d10-80ce-4e3b-bda1-5b6bdf6251da","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.013666Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:4784adaf8090017427972e5ecd4d1f9dfc38a8d3dbdb6ad0efa7a32cbc3c8603","observation_id":"3a4e8087-764a-4fde-ab6b-7e2d6d3dade8","resolution":{"observed_at":"2026-08-12T10:48:48.391424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08014","last_updated":"2025-03-11T07:15:54Z","snapshot_observed_at":"2026-08-12T13:55:24.305760Z","submitted_at":"2024-12-11T01:41:19Z","title":"MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents","version":2},"cited_work":{"arxiv_id":"2412.08014","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.08014","snapshot_observed_at":"2026-08-12T10:48:46.406202Z","title":"MAGIC: Mastering Physical Adversarial Generation in Context through Collaborative LLM Agents","venue":"cs.CV","work_id":"1939ecb8-81d9-4702-8222-85b6d4ddebce","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.061056Z"},"links":{"cited_paper":"/paper/2412.08014","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:9c5ec2fa481bd7ddef216895e530be14f8d3ad6fa62785d63bb0fd4673d77cfe","observation_id":"145a7d42-1fff-401a-a238-e83ccaf636cf","resolution":{"observed_at":"2026-08-12T10:48:46.475722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06070","last_updated":"2024-05-28T05:29:42Z","snapshot_observed_at":"2026-08-12T22:24:14.849247Z","submitted_at":"2022-01-16T15:25:24Z","title":"ALA: Naturalness-aware Adversarial Lightness Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06070","snapshot_observed_at":"2026-08-12T10:48:45.066082Z","title":"Ala: Naturalness-aware adversarial lightness attack","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.066082Z"},"links":{"cited_paper":"/paper/2201.06070","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:ee16f6ff63b027696b04b69de9e989a1e57ff9280c867a584965014e5a3a722d","observation_id":"3216e681-342c-400c-96e0-d4848e02de32","resolution":{"observed_at":"2026-08-12T10:48:45.066082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.256400Z","title":"On evaluating adversarial robustness of large vision-language models","venue":null,"work_id":"11c881f5-7246-4c97-810e-4c6502c880e0","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.070592Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:10baf2d900f8eb01ae28f28205c073608e2430a85579f496cfac449a11d18243","observation_id":"ac7130ca-b754-4af9-a1ad-cb6de616d5e7","resolution":{"observed_at":"2026-08-12T10:48:48.260042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01886","last_updated":"2024-06-26T03:29:50Z","snapshot_observed_at":"2026-08-12T13:54:55.963176Z","submitted_at":"2023-12-04T13:40:05Z","title":"InstructTA: Instruction-Tuned Targeted Attack for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01886","snapshot_observed_at":"2026-08-12T10:48:45.074404Z","title":"Instructta: Instruction-tuned targeted attack for large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.074404Z"},"links":{"cited_paper":"/paper/2312.01886","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:4108fd43304c00751ba9f56fc578d0fd4d08d2414e98de7311e33f0604821f76","observation_id":"f5256f5e-fe27-4a98-bd75-772143bdbc7a","resolution":{"observed_at":"2026-08-12T10:48:45.074404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.244288Z","title":"Transferable multimodal attack on vision-language pre-training models","venue":null,"work_id":"cbc6db18-e49a-4506-9734-912031e4e81a","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.081051Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:683e8e1d3370de1b51ff0b9725f570d66c6ad187dc48ab5040b1fe51b8742df6","observation_id":"cd03d5ca-c492-46a3-89e3-2166e0b99744","resolution":{"observed_at":"2026-08-12T10:48:48.248497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.198386Z","title":"Towards adversarial at- tack on vision-language pre-training models","venue":null,"work_id":"d34be6db-2806-4999-9233-0677f4161d5e","year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.130705Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:8859cd32a228413408381d5fbab4d0100593174d73f107c0322192861d2b6dbd","observation_id":"c0cdd27f-7577-49e8-84f5-1c4ae4132fa9","resolution":{"observed_at":"2026-08-12T10:48:48.237153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.069616Z","title":"Set-level guidance at- tack: Boosting adversarial transferability of vision-language pre-training models","venue":null,"work_id":"0ca17abe-d711-4d59-968d-3157f4b0e1a7","year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.206041Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:4e4c7f6a3e60f3b06081f04bbd9db784e25c6177fdb292b40ef4224893667218","observation_id":"11faa285-7bac-4ba0-873f-ab61e1f4b131","resolution":{"observed_at":"2026-08-12T10:48:48.101647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:48.056023Z","title":"Boosting transferability in vision-language attacks via diversification along the intersection region of adversarial trajectory","venue":null,"work_id":"54960959-ab01-488e-b46e-6faef22956ef","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.283076Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:cc177f5d0c13d7a36146be121b74098d80a2be4d78f0d50523237f51ac1dbaa4","observation_id":"fb43b57d-0e3f-43d5-a6a7-51b8d61b2136","resolution":{"observed_at":"2026-08-12T10:48:48.059640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14169","last_updated":"2024-05-23T04:52:02Z","snapshot_observed_at":"2026-08-11T07:12:03.143355Z","submitted_at":"2024-05-23T04:52:02Z","title":"Towards Transferable Attacks Against Vision-LLMs in Autonomous Driving with Typography","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14169","snapshot_observed_at":"2026-08-12T10:48:45.287680Z","title":"Towards trans- ferable attacks against vision-llms in autonomous driving with typography","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.287680Z"},"links":{"cited_paper":"/paper/2405.14169","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:5eaaa4a9d01a4e1ff1518be77ac76af8810c828169cc7e954aac5eee46933ee6","observation_id":"ffa708c9-3947-4b29-a55c-9cf780b3067a","resolution":{"observed_at":"2026-08-12T10:48:45.287680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.957758Z","title":"Textdiffuser-2: Unleashing the power of language models for text rendering","venue":null,"work_id":"9eb75be6-0f0d-48a5-bec4-e6b58b3977ef","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.292824Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:f772ca5be1f517cd34e45578475e2be1c7fba627562f5a97252b34adfc7457fc","observation_id":"474571cb-8333-43b4-815a-9125db1e13e4","resolution":{"observed_at":"2026-08-12T10:48:47.997162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09766","last_updated":"2024-03-14T17:59:35Z","snapshot_observed_at":"2026-08-06T02:47:52.285574Z","submitted_at":"2024-03-14T17:59:35Z","title":"An Image Is Worth 1000 Lies: Adversarial Transferability across Prompts on Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09766","snapshot_observed_at":"2026-08-12T10:48:45.296501Z","title":"An image is worth 1000 lies: Adversarial transferability across prompts on vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.296501Z"},"links":{"cited_paper":"/paper/2403.09766","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:716d5ce5353d6886a39a7e6e0aea89d531d01ab5023a303f24df066d86592092","observation_id":"09c6dfb6-7f04-4e80-9e47-3c58018adf70","resolution":{"observed_at":"2026-08-12T10:48:45.296501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.945912Z","title":"On the robustness of large multimodal mod- els against image adversarial attacks","venue":null,"work_id":"bc344643-1817-478d-a81f-b2e43312d7d8","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.300764Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:551f2e295cd210589615b554a077bca81db30cc8f86f0f2bfdb2db08de5d5c69","observation_id":"3c31f85b-ca59-4af3-b03c-cc86b6626988","resolution":{"observed_at":"2026-08-12T10:48:47.950273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11170","last_updated":"2024-03-22T15:31:39Z","snapshot_observed_at":"2026-08-09T06:30:07.448180Z","submitted_at":"2024-01-20T08:46:06Z","title":"Inducing High Energy-Latency of Large Vision-Language Models with Verbose Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11170","snapshot_observed_at":"2026-08-12T10:48:45.365436Z","title":"Inducing high energy-latency of large vision-language models with verbose images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.365436Z"},"links":{"cited_paper":"/paper/2401.11170","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:756fef6d38ff4255f07d3479ea9e96e26b2758c3013b9c4f84f9379405ad751a","observation_id":"e49005a2-0855-4804-b1a8-fc25f761621d","resolution":{"observed_at":"2026-08-12T10:48:45.365436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:45.385682Z","title":"Multimodal neurons in artificial neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.385682Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:171f459e01492afb5781b8d8368cb08b2c68625cef6973ce201bd994d41f6b2b","observation_id":"7977e5ac-6b8b-49aa-b551-2e6a9470ce12","resolution":{"observed_at":"2026-08-12T10:48:45.385682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:45.389653Z","title":"Blended diffusion for text-driven editing of natural images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.389653Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:08806232db9a1434d33c4b406ed7736010761fa22bc12f341e52db3e17d268f5","observation_id":"f87c4e92-7e62-42c5-b29a-d313afa8ad4a","resolution":{"observed_at":"2026-08-12T10:48:45.389653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.803372Z","title":"Dis- entangling visual and written concepts in clip","venue":null,"work_id":"68c53e16-0888-4bb5-ba3b-88aef2d925b1","year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.393835Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:0415734bf4f8dbfc302583edc06629e2115689fff97531bb8c7f5f7fc9875ce5","observation_id":"f7952bc4-54b3-4cea-802d-1ac0f53be564","resolution":{"observed_at":"2026-08-12T10:48:47.838749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:45.397035Z","title":"Patching open-vocabulary models by interpolating weights","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.397035Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:901d696030b5b8318fd3fb00e32b3256b6017f32ccd8c2c0ccf08f3464af662f","observation_id":"6695e2fb-87b9-4fa1-98bf-2e5cb403c4c6","resolution":{"observed_at":"2026-08-12T10:48:45.397035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.782689Z","title":"Defense-prefix for pre- venting typographic attacks on clip","venue":null,"work_id":"8d0fc7ea-de54-48f7-90a5-21e270ca352b","year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.400822Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:d69ec3f9e86b44260ef25cda304a1041715a2e78fd530aa1484adbaa56f40c25","observation_id":"60625371-7448-446f-be21-67bd553096ee","resolution":{"observed_at":"2026-08-12T10:48:47.788280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.615589Z","title":"Defending lvlms against vision attacks through partial-perception supervision, 2024","venue":null,"work_id":"83834dbd-f091-4c5e-8acb-6bf4d7f3c4ec","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.404438Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:f02a69ab5554cca4d5fab0b258819fd9a5a7f055da6807720cd8a0383c61cb3c","observation_id":"070e2b28-f9a3-4f9a-a4c0-fefd294b99b6","resolution":{"observed_at":"2026-08-12T10:48:47.681126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01236","last_updated":"2017-02-11T00:15:46Z","snapshot_observed_at":"2026-07-06T05:17:20.642708Z","submitted_at":"2016-11-04T01:11:02Z","title":"Adversarial Machine Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01236","snapshot_observed_at":"2026-08-12T10:48:45.408168Z","title":"Ad- versarial machine learning at scale","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.408168Z"},"links":{"cited_paper":"/paper/1611.01236","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:74f3cceef8a0648839cbc4c45c4cf22dc6465b3706fb0901044393495cf5d454","observation_id":"cbe3766e-6983-4894-a68a-269518e540d8","resolution":{"observed_at":"2026-08-12T10:48:45.408168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:45.549168Z","title":"Adver- sarial examples in the physical world","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.549168Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:35b2c5781030068ff6853c6645dc62c990627fb71873bae5b198b38898a89fe4","observation_id":"4e34ba8c-1c18-42cf-af62-868a7192a2f2","resolution":{"observed_at":"2026-08-12T10:48:45.549168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.596633Z","title":"Accessorize to a crime: Real and stealthy attacks on state-of-the-art face recognition","venue":null,"work_id":"10bb8738-8cb0-4308-842e-40b17290eff4","year":2016},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.580877Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:a66835eea585e145a7c25bddaeeb0f1eca151ce719d82b80919cce93789a160d","observation_id":"8c0960cc-a898-421b-ba7d-434aa136a5dd","resolution":{"observed_at":"2026-08-12T10:48:47.601997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.540778Z","title":"Robust physical-world attacks on deep learning visual classification","venue":null,"work_id":"82f987e0-e7c3-4a17-a326-e756e5b1ca97","year":2018},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.584533Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:5c2cbce22a6bc7e5c5b19a57c0afc06a2a039682d40329bf17abfbfd42098e5b","observation_id":"acbefc5f-ff81-44d3-b807-6ad022e671fb","resolution":{"observed_at":"2026-08-12T10:48:47.588605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.360999Z","title":"Towards transferable targeted 3d adversarial attack in the physical world","venue":null,"work_id":"295f3829-7053-43fb-be23-9be0d5311195","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.588548Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:1a0f26ebb6719fdb920a684efec97e17ab7f6d53f1a1b11b736dc3082f2bc74a","observation_id":"2cdecedd-0da2-4719-b7f6-7a826f997784","resolution":{"observed_at":"2026-08-12T10:48:47.398716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.350051Z","title":"Adversarial t-shirt! evading person detectors in a physical world","venue":null,"work_id":"95e5cced-239e-4db4-aa44-e25e7db05972","year":2020},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.592280Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:988d7f33457e4564d90e39f43339a9e95635506d7a39cff58cf7861c2efd6042","observation_id":"b3b4cd52-3786-4608-ae85-fbe44f906476","resolution":{"observed_at":"2026-08-12T10:48:47.353693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.339194Z","title":"Fooling thermal infrared pedestrian detectors in real world using small bulbs","venue":null,"work_id":"73b6b096-aeb9-4a7f-a67b-fe0ea1152a2f","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.597309Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:12cb87c87785484f1bb1b8843a835332cd169264724292da54816c76a50b7f5b","observation_id":"f3ceabdf-d21f-4450-b350-97bd03b9b2e9","resolution":{"observed_at":"2026-08-12T10:48:47.343421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.310167Z","title":"Infrared invisible clothing: Hiding from infrared detectors at multiple angles in real world","venue":null,"work_id":"1d3d8ff1-a13c-4079-8e2f-60fd10a334f4","year":2022},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.636881Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:c5f4833f1db78668efa1563037825d0f984c433e8ec9af14107675e7ec0671d2","observation_id":"2b2d1cd6-6f27-4c9a-9029-48c52e810cef","resolution":{"observed_at":"2026-08-12T10:48:47.330137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.276429Z","title":"Hotcold block: Fooling thermal infrared detectors with a novel wearable design","venue":null,"work_id":"397dd103-e005-4e32-9272-6701bd564890","year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.682499Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:3d589ba6297bca39f67ef3915eb01142e3b96d498986be7d4cfc30a6a86bbc62","observation_id":"af9c87b8-c84c-4b71-a13a-e3dc5b7207f4","resolution":{"observed_at":"2026-08-12T10:48:47.280549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.104023Z","title":"Adversarial camouflage: Hiding physical- world attacks with natural styles","venue":null,"work_id":"daecc7b1-e84b-453c-ada7-f7b209df8307","year":2020},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.700581Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:073f32307f4990beb7fe28c233ba77d95ddb13c3b3f94e867e301e69187a0373","observation_id":"69b89cfe-1f66-4efa-affc-6774cc2a4bf3","resolution":{"observed_at":"2026-08-12T10:48:47.213692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.064795Z","title":"Uni- fied adversarial patch for cross-modal attacks in the physical world","venue":null,"work_id":"49a39980-3d80-465b-9147-69d02a31fadc","year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.704277Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:dfbeda452b0931322dcc83969d778d882852ba7ebeaf87c323886bc9aa6ca668","observation_id":"dc9c1e9a-f670-481d-9cef-c6846de4cbec","resolution":{"observed_at":"2026-08-12T10:48:47.068983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.053028Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"0bb41cf6-5c1e-41cd-9148-c80f1dfd8579","year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.708071Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:3cf6e8cfdefb2952c22c4c770938ac5f6ffe890725e973d6317e3ee69d43924c","observation_id":"6b928e87-84ca-4978-ab13-29b03ccb9fdf","resolution":{"observed_at":"2026-08-12T10:48:47.057281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:47.040553Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":"a7a69004-d185-4350-8fe2-9d9a7979b8f2","year":2017},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.711818Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:96eee60d99baf204a8c8c9cdc1c61fb29a735d21cf20aeec42532b7d395be184","observation_id":"1db9c836-f655-43c3-be4d-8e930646beb8","resolution":{"observed_at":"2026-08-12T10:48:47.044858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-12T10:48:45.715928Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.715928Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:3db7feefaf633572c62a66e054f87fe4f91494dbff4858bf8eca6ec9d960b639","observation_id":"676dac00-ae12-478b-9c19-07031a83cdb6","resolution":{"observed_at":"2026-08-12T10:48:45.715928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.964766Z","title":"Textdiffuser: Diffusion models as text painters","venue":null,"work_id":"1cc7e9db-cb85-4a06-a5f0-2bdc7db8ad7a","year":2024},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.720628Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:1d2da97138b15b0a819f901a82f322141797ba20459b22fbc59473b0e50d3461","observation_id":"d3e52cf9-54d1-4c00-9fb4-86d53d62740c","resolution":{"observed_at":"2026-08-12T10:48:47.030989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14115","last_updated":"2024-09-26T15:30:00Z","snapshot_observed_at":"2026-08-11T18:47:05.669341Z","submitted_at":"2023-12-21T18:40:34Z","title":"LingoQA: Visual Question Answering for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14115","snapshot_observed_at":"2026-08-12T10:48:45.724257Z","title":"Lingoqa: Visual question answering for au- tonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.724257Z"},"links":{"cited_paper":"/paper/2312.14115","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:ba0016a33a2a480be54e736572d61fe55295c96e7c9b535dfa98cdffb89193da","observation_id":"1e92ab44-e181-4564-93c5-4b565c4bc00c","resolution":{"observed_at":"2026-08-12T10:48:45.724257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:45.728189Z","title":"Instructblip: Towards general-purpose vision- language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.728189Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:2b6085fb8a8c1686959e867f3e1298891ee83a7ddb8105df078c0cb537ef94a6","observation_id":"8b04b758-3b03-4cd7-a2ab-a7f3b704e047","resolution":{"observed_at":"2026-08-12T10:48:45.728189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-12T10:48:45.868817Z","title":"What color is the traffic light?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:45.868817Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:31f0ae20c2a31fad1693c0a68f17ea994bfabe977e2e47b0ec954f5e5714cea1","observation_id":"3541e0bc-722a-44f4-9506-9c0f60ac74cd","resolution":{"observed_at":"2026-08-12T10:48:45.868817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.945440Z","title":null,"venue":null,"work_id":"29473ea6-93e2-41c8-8524-7ac4a43a8450","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.001670Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:c1dac44be2a19bf6a33a36b57d69b3aaa585d5956eb6b65a9496d6b8ad7623eb","observation_id":"833ecf8b-6c0a-45c1-b5a0-0b8c86684a08","resolution":{"observed_at":"2026-08-12T10:48:46.950480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.933756Z","title":null,"venue":null,"work_id":"16912534-b228-4445-9698-f533c849d140","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.006249Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:5a25283ab0184a95c938cd17b2cbfe23f5c3e6706a33c5d80d0357caafb6fd77","observation_id":"a796c973-ab8b-4611-b8f6-56d235886a28","resolution":{"observed_at":"2026-08-12T10:48:46.937711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.796013Z","title":null,"venue":null,"work_id":"9c7167d7-e8a4-4b52-98a8-367de6b589a2","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.010987Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:d83ad524c48d2db6e6151ebc67104de46b18d47da0ce6184d3a5e08b84bd0f32","observation_id":"21916217-b062-4b09-aa23-d164e0d419e9","resolution":{"observed_at":"2026-08-12T10:48:46.879841Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.784115Z","title":null,"venue":null,"work_id":"32d88ae8-2316-499f-8052-88b52d932413","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.015327Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:6d01061ab1d07bba6de3aae70b0a64feef0187f8eee9c2fc7cf2da6f3238a7d1","observation_id":"3750fd6c-f257-4ab3-917a-4af553051763","resolution":{"observed_at":"2026-08-12T10:48:46.788254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.772397Z","title":null,"venue":null,"work_id":"886891e7-c87b-4d11-8951-28341770a1cf","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.119310Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:326a83820003609fb43661bc26dff76bcadb316d921067d64b148d20357253f1","observation_id":"52dd5a22-b884-479b-be75-0153a69ef098","resolution":{"observed_at":"2026-08-12T10:48:46.776382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.661414Z","title":null,"venue":null,"work_id":"5565facf-c06b-4105-bf33-4b6d360ed6ef","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.176161Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:8287935b55c72ff230f50d3dcdf83bf1d48f8b5253ab7cafc34c032caa48ac77","observation_id":"f1d58c31-a94e-4c01-adec-81ef33110274","resolution":{"observed_at":"2026-08-12T10:48:46.720866Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.650054Z","title":null,"venue":null,"work_id":"47613ecf-c01f-4f85-ba64-c063dc175f57","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.271794Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:9f39f7c3070239b247ed91a28c7fadec42c8ae772ba95538c71b349d247f09b2","observation_id":"44c9d7d8-c66f-45b5-a7b4-f06cc5e64c39","resolution":{"observed_at":"2026-08-12T10:48:46.653487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.638873Z","title":null,"venue":null,"work_id":"3a79b966-daab-4429-b230-a80f61a420b2","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.275743Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:c122ad34845a4ef37c908552e3f6ecb53a653e0e56439bc1465309d525de73cd","observation_id":"844466fc-bf8e-45b0-b5fd-b3452e64edbb","resolution":{"observed_at":"2026-08-12T10:48:46.642018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.620423Z","title":null,"venue":null,"work_id":"cfb32cd0-0b1e-4e5f-9902-0141d83bd57f","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.279441Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:0505c3652c1f3a8bc276002ea1185cfb99cc96fad18e03eb15a6ec917ecd6d71","observation_id":"f80e2030-bbc6-4cf3-81fe-b1914748ed19","resolution":{"observed_at":"2026-08-12T10:48:46.631034Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:48:46.514777Z","title":"colobus” causes the VLM to incorrectly identify the entity in the image. In LingoQA, inserting the phrase “Red light","venue":null,"work_id":"ec333611-ea65-46de-8e8f-1cfef3d53554","year":null},"citing_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:48:46.283268Z"},"links":{"citing_paper":"/paper/2412.00114"},"observation_digest":"sha256:dfeaf3389f0bddd97b1ea19a72ddad9e54ef10641a8bdc2294c61ad66623fd6f","observation_id":"0271bf1b-1787-46e6-8cab-e11bbb31e059","resolution":{"observed_at":"2026-08-12T10:48:46.561343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2412.00114."}