{"as_of":"2026-08-12T23:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:672d3117fd6965322294c3d36fc8adcf08c59826214a13e7cd77db1b5acb1282","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:52:06.558105Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:18:51.206793Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T08:17:36.629263Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12722","snapshot_observed_at":"2026-08-05T21:18:51.206793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09016","last_updated":"2025-09-10T05:08:47Z","snapshot_observed_at":"2026-08-09T06:48:43.608452Z","submitted_at":"2025-08-12T15:30:44Z","title":"A Survey on Training-free Alignment of Large Language Models","version":4},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-05T21:18:51.206793Z"},"links":{"cited_paper":"/paper/2412.12722","citing_paper":"/paper/2508.09016"},"observation_digest":"sha256:5d451b6cb2d1751b00b647248f250d2750793585567dd46e1128e14f633ec337","observation_id":"6789da18-c782-4e69-b559-861ca7543d87","resolution":{"observed_at":"2026-08-05T21:18:51.206793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"cited_work":{"arxiv_id":"2412.12722","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12722","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"De- fending lvlms against vision attacks through partial-perception supervision","venue":null,"work_id":"6cff84d7-cf5a-4056-85e9-35576be975ff","year":2024},"citing_paper":{"arxiv_id":"2602.02280","last_updated":"2026-05-12T03:47:11Z","snapshot_observed_at":"2026-08-11T07:06:38.718933Z","submitted_at":"2026-02-02T16:20:51Z","title":"RACC: Representation-Aware Coverage Criteria for LLM Safety Testing","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T08:12:55.296932Z"},"links":{"cited_paper":"/paper/2412.12722","citing_paper":"/paper/2602.02280"},"observation_digest":"sha256:1bb1359ed124d1ad8b61283090be0f4ae8e9d97def23febe08084b0de97689a7","observation_id":"e0b10156-c474-44e0-817a-960849da6d09","resolution":{"observed_at":"2026-05-16T08:17:36.631161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12722/citation-record","integrity":"/paper/2412.12722/integrity","json":"/paper/2412.12722/citation-record.json","paper":"/paper/2412.12722"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T13:52:06.399038Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.399038Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:6c100eb3853e1f3fe94cc95eb2677195c6296b95ab44097609098071c6941b1b","observation_id":"f91bcbe3-94bf-4516-891a-ec631693f6e8","resolution":{"observed_at":"2026-08-11T13:52:06.399038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-11T13:52:06.412507Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.412507Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:43e5150cc02045f8eebf33b5350e6a6f74c0c0fa594680bc914f93d31f4384de","observation_id":"07c7b448-4eb4-46ff-82c0-d8656569421f","resolution":{"observed_at":"2026-08-11T13:52:06.412507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-07-06T17:02:09.539730Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-11T13:52:06.418197Z","title":"Cao, Y ., Xing, Y ., Zhang, J., Lin, D., Zhang, T., Tsang, I., Liu, Y ., and Guo, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.418197Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:b8ba244f891f8abbd596f4065ffe2b40679d712ecffd9e4e6e1a2b91cd9db24a","observation_id":"a7a6eb8c-ef97-4fdd-b457-acac2c0c6d05","resolution":{"observed_at":"2026-08-11T13:52:06.418197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:07.259664Z","title":"And in Table 10, we demonstrate the statistical significance using a t-test, with p-values consistently less than 0.05, confirming their significance","venue":null,"work_id":"84ed7732-4a85-4b38-a9d0-43c74719acd0","year":2018},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.558105Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:6f14f9ff71dd5484aa22d6e27619a29679b61d10a3a4aec47fadb9c16e653079","observation_id":"d6a13326-9ff3-46f8-b0eb-72686175bc09","resolution":{"observed_at":"2026-08-11T13:52:07.267093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00296","last_updated":"2026-07-04T04:35:22Z","snapshot_observed_at":"2026-08-12T22:33:49.942321Z","submitted_at":"2024-10-01T00:37:29Z","title":"VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00296","snapshot_observed_at":"2026-08-11T13:52:06.435588Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.435588Z"},"links":{"cited_paper":"/paper/2410.00296","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:fea49c49b452fb3b318245b6cd015ed5287105bce889f6aba9b6dd36b09e7d01","observation_id":"977aa6ab-e8cc-4dc0-a45c-a83c7871c729","resolution":{"observed_at":"2026-08-11T13:52:06.435588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-11T13:52:06.441334Z","title":"B., and Mor- datch, I","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.441334Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:21262fa18da43e3ff84d19d87a05d67eb770b4aa23609a6c65884e1090e6fcef","observation_id":"40fc9fdb-9720-4fb6-8076-796de0e50df8","resolution":{"observed_at":"2026-08-11T13:52:06.441334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09250","last_updated":"2026-05-22T03:11:22Z","snapshot_observed_at":"2026-08-01T08:01:02.690476Z","submitted_at":"2024-06-13T15:55:04Z","title":"MirrorCheck: Efficient Adversarial Defense for Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09250","snapshot_observed_at":"2026-08-11T13:52:06.446381Z","title":"Mirrorcheck: Efficient adversarial defense for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.446381Z"},"links":{"cited_paper":"/paper/2406.09250","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:da5775d3689a1ad776720278feab4a985b142d64474f8032587b0d828c262245","observation_id":"b9ef07a7-d525-4177-8901-260be3fe3e69","resolution":{"observed_at":"2026-08-11T13:52:06.446381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05608","last_updated":"2025-01-19T16:23:38Z","snapshot_observed_at":"2026-08-12T23:35:24.639756Z","submitted_at":"2023-11-09T18:59:11Z","title":"FigStep: Jailbreaking Large Vision-Language Models via Typographic Visual Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05608","snapshot_observed_at":"2026-08-11T13:52:06.451631Z","title":"Figstep: Jailbreaking large vision- language models via typographic visual prompts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.451631Z"},"links":{"cited_paper":"/paper/2311.05608","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:36273c4938a5f0033e4b1f86352abe82485a9a3dabdba237fe71b85e34bb0cc3","observation_id":"7b1736b7-ac9a-4c0e-8d82-b797a7d691ff","resolution":{"observed_at":"2026-08-11T13:52:06.451631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03749","last_updated":"2024-02-06T06:30:34Z","snapshot_observed_at":"2026-08-10T18:28:49.651793Z","submitted_at":"2024-02-06T06:30:34Z","title":"Vision Superalignment: Weak-to-Strong Generalization for Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03749","snapshot_observed_at":"2026-08-11T13:52:06.457092Z","title":"Huang, Y ., Liang, L., Li, T., Jia, X., Wang, R., Miao, W., Pu, G., and Liu, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.457092Z"},"links":{"cited_paper":"/paper/2402.03749","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:147323dd88bc26e35be3b694430e10c72aaf74d5c7ba73d6febbc2834bea59fd","observation_id":"1ff9fd07-66ba-4f93-92af-82769d679bc3","resolution":{"observed_at":"2026-08-11T13:52:06.457092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:06.462433Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.462433Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:2d6bb3b189355589397578fcb501b5a0b4db00bacdc23669bc3d6799bd644431","observation_id":"ecc7c7e8-cf79-4bbd-8d72-16db1904e85c","resolution":{"observed_at":"2026-08-11T13:52:06.462433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06782","last_updated":"2024-07-25T23:32:21Z","snapshot_observed_at":"2026-08-06T16:12:39.214839Z","submitted_at":"2024-02-09T21:05:01Z","title":"Debating with More Persuasive LLMs Leads to More Truthful Answers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06782","snapshot_observed_at":"2026-08-11T13:52:06.467601Z","title":"Kirillov, A., Mintun, E., Ravi, N., Mao, H., Rolland, C., Gustafson, L., Xiao, T., Whitehead, S., Berg, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.467601Z"},"links":{"cited_paper":"/paper/2402.06782","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:d0e4dcc1524d160e86011de8fa3a7a7e91fd5a0a8a1aa88d236f2abc606cb1db","observation_id":"8e6ddbc5-15e5-47e2-8f9d-9e220b70407d","resolution":{"observed_at":"2026-08-11T13:52:06.467601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:06.472783Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.472783Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:317d77e8d9f8a14da3d700b6b846fadcc421eb227da9b8f0e098294f284998fc","observation_id":"79fd509e-e8af-4387-993b-e99923945b17","resolution":{"observed_at":"2026-08-11T13:52:06.472783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12915","last_updated":"2024-01-23T17:07:18Z","snapshot_observed_at":"2026-08-12T20:07:56.778712Z","submitted_at":"2024-01-23T17:07:18Z","title":"Red Teaming Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12915","snapshot_observed_at":"2026-08-11T13:52:06.478022Z","title":"One prompt word is enough to boost adversarial robustness for pre- trained vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.478022Z"},"links":{"cited_paper":"/paper/2401.12915","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:0957e17b0b7050cf5a847373fc49cb8fb319e528fc63822f59d63c4edde0167e","observation_id":"9c907a8f-6ff2-4370-8cdf-1f9011ab0d71","resolution":{"observed_at":"2026-08-11T13:52:06.478022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20505","last_updated":"2024-07-30T02:41:32Z","snapshot_observed_at":"2026-08-12T23:12:23.790748Z","submitted_at":"2024-07-30T02:41:32Z","title":"Interpreting and Mitigating Hallucination in MLLMs through Multi-agent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20505","snapshot_observed_at":"2026-08-11T13:52:06.484604Z","title":"Interpreting and mitigating hallucination in mllms through multi-agent debate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.484604Z"},"links":{"cited_paper":"/paper/2407.20505","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:d885aaf11fc316d4a39c6974f4c7a453dafd7f899faa4be0492a752cf3afdca8","observation_id":"ca673e37-1847-4c5e-81fc-948085644f94","resolution":{"observed_at":"2026-08-11T13:52:06.484604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02882","last_updated":"2024-08-06T01:20:12Z","snapshot_observed_at":"2026-08-12T23:08:05.171551Z","submitted_at":"2024-08-06T01:20:12Z","title":"Compromising Embodied Agents with Contextual Backdoor Attacks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02882","snapshot_observed_at":"2026-08-11T13:52:06.489864Z","title":"Com- promising embodied agents with contextual backdoor attacks, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.489864Z"},"links":{"cited_paper":"/paper/2408.02882","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:783c8874496427a5a75438a1b7c59f68c6c00059eaed0b306fb5df07e56df25f","observation_id":"64a1b9dd-4f1f-4667-bedd-474ae84b0984","resolution":{"observed_at":"2026-08-11T13:52:06.489864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00626","last_updated":"2025-02-13T03:11:20Z","snapshot_observed_at":"2026-08-10T21:35:22.483372Z","submitted_at":"2024-02-01T14:41:20Z","title":"Vision-LLMs Can Fool Themselves with Self-Generated Typographic Attacks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00626","snapshot_observed_at":"2026-08-11T13:52:06.505659Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.505659Z"},"links":{"cited_paper":"/paper/2402.00626","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:4a7a0da8a604dcdbe0e5526ad08a4861dbcf0b6f336107c9c2ddf8da8894d9e2","observation_id":"193def2a-7b71-4835-8ff9-56d4142b2fed","resolution":{"observed_at":"2026-08-11T13:52:06.505659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10529","last_updated":"2024-08-24T13:28:45Z","snapshot_observed_at":"2026-08-04T13:36:57.704335Z","submitted_at":"2024-05-17T04:19:19Z","title":"Safeguarding Vision-Language Models Against Patched Visual Prompt Injectors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10529","snapshot_observed_at":"2026-08-11T13:52:06.510672Z","title":"Safe- guarding vision-language models against patched visual prompt injectors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.510672Z"},"links":{"cited_paper":"/paper/2405.10529","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:0182fbd17a7538147ead669a7d8340ebc17aa912df5a43ca10141d6a63d3d9f8","observation_id":"d8cd0a61-a02c-4aad-a3d9-4a2b65ee099a","resolution":{"observed_at":"2026-08-11T13:52:06.510672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T13:52:06.515912Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.515912Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:7435c45da5e6a5991af66a8c2e74f32fe1d29076dcb973e2132521c1fb715064","observation_id":"f19e412a-8dab-4f56-a416-a9e83a48042e","resolution":{"observed_at":"2026-08-11T13:52:06.515912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-10T03:38:23.239399Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-11T13:52:06.521313Z","title":"Drivevlm: The conver- gence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.521313Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:631bda383e3539f0da9656331ebe2e40398f55f1f3a298f817a880a9462fe79c","observation_id":"2434febd-cfce-489f-9b6b-f4e12f6a35e3","resolution":{"observed_at":"2026-08-11T13:52:06.521313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-08-09T14:46:30.842437Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15585","snapshot_observed_at":"2026-08-11T13:52:06.526634Z","title":"T., Jia, X., Sun, W., Wu, C., Chen, J., Hu, X., Li, Y ., Wang, X., Zhang, N., Tuan, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.526634Z"},"links":{"cited_paper":"/paper/2504.15585","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:406c4d7772a67f50c7e6591cdc94d1d3a21352ff0406d837c4b18d2416708c27","observation_id":"fd6c90b7-9b6e-4aaf-8fc4-9b34e96372f1","resolution":{"observed_at":"2026-08-11T13:52:06.526634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-11T13:52:06.537012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.537012Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:9323e863332f44eee80e88756ff464de56b675c8f05264e1aa281a5fa8644460","observation_id":"0ca53795-b073-4c7c-9897-dff41b740ee3","resolution":{"observed_at":"2026-08-11T13:52:06.537012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10766","last_updated":"2025-03-15T00:49:45Z","snapshot_observed_at":"2026-07-06T17:04:17.738921Z","submitted_at":"2023-12-17T17:02:14Z","title":"JailGuard: A Universal Detection Framework for LLM Prompt-based Attacks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10766","snapshot_observed_at":"2026-08-11T13:52:06.542812Z","title":"Jailguard: A uni- versal detection framework for llm prompt-based attacks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.542812Z"},"links":{"cited_paper":"/paper/2312.10766","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:eb375f7b6b88bf935fd15ae8f2948d3bd7d892b424da41f68590103ea79cb653","observation_id":"ab662ad0-9046-4ac6-8eff-add245f9eadc","resolution":{"observed_at":"2026-08-11T13:52:06.542812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:07.301005Z","title":"RTA-100 is a real-world typographic attack dataset, in which the handwritten tag from incorrect classes is placed next to the objects in the image","venue":null,"work_id":"05958dc8-c2f3-483c-8dc9-68cde537914a","year":2024},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.547824Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:1496ecef5cc837a32cf5023a7457795e73141db6421d1174735820f9883bb720","observation_id":"47e8d337-8f74-4057-acbd-26d4bfc8cd67","resolution":{"observed_at":"2026-08-11T13:52:07.308907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:07.281088Z","title":"Both MM-safetyBench and HADES are datasets for evaluating LVLM in safety-critical scenarios","venue":null,"work_id":"f8318620-cd38-42e0-8b50-86167d7e44af","year":2024},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.552746Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:598d173e60873ac71005803b447cf213075e64a61dd2eb8e5507ca4b4fc844e1","observation_id":"315ab618-47e5-4b99-84fb-d3bf2bbc54e1","resolution":{"observed_at":"2026-08-11T13:52:07.286936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02906","last_updated":"2024-06-17T16:53:49Z","snapshot_observed_at":"2026-08-07T09:15:19.297634Z","submitted_at":"2024-01-05T17:05:42Z","title":"MLLM-Protector: Ensuring MLLM's Safety without Hurting Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02906","snapshot_observed_at":"2026-08-11T13:52:06.500384Z","title":"Mllm-protector: Ensuring mllm’s safety without hurting performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.500384Z"},"links":{"cited_paper":"/paper/2401.02906","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:b1ae7c70da7efa1eb4e4d2979da9330e9738f19a24c28e3996ec16a9f84d20dc","observation_id":"30a71ed2-5819-4d5e-9412-d3d826c96962","resolution":{"observed_at":"2026-08-11T13:52:06.500384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:07.325202Z","title":"Feature squeezing: Detecting adversarial examples in deep neural networks","venue":null,"work_id":"2c053474-0e03-4581-931d-b2ee9264fc31","year":2018},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.531864Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:283ff236f7747ac9222a728df697a59d530bbfc0c243740614c9fcc901e93e26","observation_id":"3469c160-a225-4e6a-bbdb-0b86803b98b3","resolution":{"observed_at":"2026-08-11T13:52:07.332672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:52:06.495063Z","title":"M., Vedaldi, A., Zisserman, A., and Jawahar, C","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.495063Z"},"links":{"citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:76070efbbccb479f32762b984963a4775bdb0234d20182e4bcde7124a5abd39f","observation_id":"dfdd65c6-6f08-4d00-8d8d-5c21a5ee1b48","resolution":{"observed_at":"2026-08-11T13:52:06.495063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T13:52:06.405908Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.405908Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:fd8403e70ebf8e15ae7eb297a03f2bbbf072b63899b789530eb3e2c9e00eed3a","observation_id":"65fc6f2a-e77c-46cf-a783-5238f208294b","resolution":{"observed_at":"2026-08-11T13:52:06.405908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14169","last_updated":"2024-05-23T04:52:02Z","snapshot_observed_at":"2026-08-11T07:12:03.143355Z","submitted_at":"2024-05-23T04:52:02Z","title":"Towards Transferable Attacks Against Vision-LLMs in Autonomous Driving with Typography","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14169","snapshot_observed_at":"2026-08-11T13:52:06.429481Z","title":"S., and Guo, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.429481Z"},"links":{"cited_paper":"/paper/2405.14169","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:a00656873a8656ba6f36d7eadb64613290997380675f24e214cd93927470faed","observation_id":"49825eb2-d8e9-4cde-86e1-cd5cf62956d0","resolution":{"observed_at":"2026-08-11T13:52:06.429481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00114","last_updated":"2025-04-08T02:54:58Z","snapshot_observed_at":"2026-08-12T13:55:29.755485Z","submitted_at":"2024-11-28T05:55:13Z","title":"SceneTAP: Scene-Coherent Typographic Adversarial Planner against Vision-Language Models in Real-World Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00114","snapshot_observed_at":"2026-08-11T13:52:06.423820Z","title":"Cheng, H., Xiao, E., Gu, J., Yang, L., Duan, J., Zhang, J., Cao, J., Xu, K., and Xu, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T13:52:06.423820Z"},"links":{"cited_paper":"/paper/2412.00114","citing_paper":"/paper/2412.12722"},"observation_digest":"sha256:6f2a5e3635ecd65542dc141f6a41056a0b5073c05e048622a2021f2830ec1087","observation_id":"f6e69485-f1b8-4bfb-a5b2-c017f58bba82","resolution":{"observed_at":"2026-08-11T13:52:06.423820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.12722","last_updated":"2025-09-04T06:43:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T13:55:52.046809Z","submitted_at":"2024-12-17T09:38:58Z","title":"Defending LVLMs Against Vision Attacks through Partial-Perception Supervision"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 2 inbound Pith citation observations for arXiv:2412.12722."}