{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc3f4fe201433057b17b19a0845482a19eccd798fa382ed5f3670d27000ba2cb","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:45:28.405188Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22469/citation-record","integrity":"/paper/2507.22469/integrity","json":"/paper/2507.22469/citation-record.json","paper":"/paper/2507.22469"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.677908Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.677908Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e247041ccec2e3e72c7a24d6782bd41a6e69c0bc02f5b0e09d41095081280c32","observation_id":"9cc01c1d-a0d2-4ed7-81f4-a7398bcaeb91","resolution":{"observed_at":"2026-08-06T11:45:25.677908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-06T11:45:25.682150Z","title":"Flamingo: a visual language model for few-shot learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.682150Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:eb82edb51737e2793682e790cc2a70942326e9638b75de7b55302ca51743de1d","observation_id":"9fa5cd60-95ba-42e4-871e-3961f6655280","resolution":{"observed_at":"2026-08-06T11:45:25.682150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.686108Z","title":"Large scale GAN training for high fidelity natural image synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.686108Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:57b6d4a1b3ecc5e79e8d89601931a6ebbe6a726071e6065dfffcdfcecab9e201","observation_id":"4d6e501a-ea0a-466a-a501-cb79b27d68f1","resolution":{"observed_at":"2026-08-06T11:45:25.686108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.689434Z","title":"Roop unleashed","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.689434Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f60cc273ef2fea74734ce1fa7a68bde2c59832dc477928ba23dc874a5b4ebcfd","observation_id":"a4444121-126e-4e64-a904-7fa2827bba1c","resolution":{"observed_at":"2026-08-06T11:45:25.689434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.526116Z","title":"End-to-end reconstruction-classification learning for face forgery detection","venue":null,"work_id":"4d4734ae-1309-4482-8130-28ed549bbf91","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.692672Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ec6b721e753149417aa2bc87433b4d0d1c6e61a8f6de49620d325c59ae252e73","observation_id":"ea8e19f1-b90b-4ba7-afe0-10e5eaa17029","resolution":{"observed_at":"2026-08-06T11:45:30.545072Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.696042Z","title":"M., and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.696042Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d0bb3842264d3017b5800dd69efd9e2391369987441b73b63e146f20d6ef43b0","observation_id":"3649df1b-a8b6-42c4-9629-d39ffd10b97f","resolution":{"observed_at":"2026-08-06T11:45:25.696042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17419","last_updated":"2024-08-21T07:42:02Z","snapshot_observed_at":"2026-08-07T20:34:56.788333Z","submitted_at":"2023-10-26T14:23:45Z","title":"AntifakePrompt: Prompt-Tuned Vision-Language Models are Fake Image Detectors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17419","snapshot_observed_at":"2026-08-06T11:45:25.699244Z","title":"Antifakeprompt: Prompt-tuned vision-language models are fake image detectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.699244Z"},"links":{"cited_paper":"/paper/2310.17419","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8566690850658dd241af83f108f9fd284f878a2f96926e897eea411967a60259","observation_id":"4ee77696-f2aa-4b4a-83ea-38cea61ac296","resolution":{"observed_at":"2026-08-06T11:45:25.699244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.703813Z","title":"Simswap: An efficient framework for high fidelity face swapping","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.703813Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8ae6a9b36f2843d88b509f7cc7e2513fb7d1543c876b4f3fa3cbf8c4ba24d862","observation_id":"25d2a2dd-db83-4058-86f7-e4d85a8780b8","resolution":{"observed_at":"2026-08-06T11:45:25.703813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02577","last_updated":"2021-05-06T10:44:32Z","snapshot_observed_at":"2026-08-06T09:12:53.226793Z","submitted_at":"2021-05-06T10:44:32Z","title":"Local Relation Learning for Face Forgery Detection","version":1},"cited_work":{"arxiv_id":"2105.02577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.02577","snapshot_observed_at":"2026-08-06T11:45:30.271207Z","title":"Local Relation Learning for Face Forgery Detection","venue":"cs.CV","work_id":"6e099be2-e5ff-4f6a-bee7-186723a27edc","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.707088Z"},"links":{"cited_paper":"/paper/2105.02577","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:70652ad018e98b5440d5737389f1c14aaa67b6acb16eb8eee6a7290259d0f63c","observation_id":"dcd0eef2-ce9b-4277-9464-1b7a72f143b5","resolution":{"observed_at":"2026-08-06T11:45:30.334523Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.710366Z","title":"Xception: Deep learning with depthwise separable convolutions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.710366Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d0e80c9badf2d625450a0e84b2f540158f712cf8126f0c6036c5863e65dfd67c","observation_id":"58adea83-b287-460e-b8b4-748e978dfe5b","resolution":{"observed_at":"2026-08-06T11:45:25.710366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.657030Z","title":null,"venue":null,"work_id":"50e8d142-6ed2-42f9-939a-2e703eb64165","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.713915Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:26268347e8c94de35928ef52b3001f49c41bee9d3b2e16fa6dfd421270afb9f0","observation_id":"8141a213-e235-4a42-a869-eb46adcf00a1","resolution":{"observed_at":"2026-08-06T11:45:33.739891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T11:45:25.716907Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.716907Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:127bf27c2af1c18aed9726160c675d12117e5c48658c9a6549f808a48f068827","observation_id":"c52c6a3e-714a-487b-9bd8-b5d4dcf8eb05","resolution":{"observed_at":"2026-08-06T11:45:25.716907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T11:45:25.720181Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.720181Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c0dd0b616d517a25028260ccea07782563f2a4f29d5870132d839780717d85d2","observation_id":"f443438e-f66e-456f-8050-157487ba6878","resolution":{"observed_at":"2026-08-06T11:45:25.720181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.723587Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.723587Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9565a4784d0ea1ba14595e62b9e4aa15d1ded383cfd0f4aca017df5a81fcd7b7","observation_id":"a7ba93c4-b437-4bca-84e4-c819341c01fb","resolution":{"observed_at":"2026-08-06T11:45:25.723587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-06T11:45:25.726493Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.726493Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3061c4e674897292fbcc8c14b4262595852b802c07d6d20251ca40b8dbcf05f8","observation_id":"0844cb37-fe0e-4e30-999e-d600b69618ad","resolution":{"observed_at":"2026-08-06T11:45:25.726493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.510865Z","title":"Implicit identity leakage: The stumbling block to improving deepfake detection generalization","venue":null,"work_id":"5fc77f47-2806-4885-9337-ee459cc626f9","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.729823Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d1a103d11b184dd0e7632937d7a0ee523fc32ce73e12e201afdd68258d65d05c","observation_id":"90be74f7-7faa-4504-a1a3-ca14fac78960","resolution":{"observed_at":"2026-08-06T11:45:33.587314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T11:45:25.732820Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.732820Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f92d08b9911c8efe1a2fabfaa6505c32d210755038a4f1289eefa86e87d5d055","observation_id":"bf6f11b3-47d6-4648-b225-a4f6200908b5","resolution":{"observed_at":"2026-08-06T11:45:25.732820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1636755","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.042716Z","title":"Asking chatgpt to generate a random number","venue":null,"work_id":"400f225f-d367-488f-b1b5-e21e90e7b3c8","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.735678Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d045306857045b5f6cb557ea43a387b86b54c30d907ed63895f9f714c31f8769","observation_id":"3a0a7b10-c991-41cf-a46d-6a0b34b9167b","resolution":{"observed_at":"2026-08-06T11:45:30.111538Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.324752Z","title":"J., Pouget - Abadie, J., Mirza, M., Xu, B., Warde - Farley, D., Ozair, S., Courville, A","venue":null,"work_id":"9dd15ec4-b3ec-4e20-a010-57b216e3a02e","year":2014},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.738503Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:fb0ecd0a24a38dae80217ddc5560db00db6acfd781995d72f3ca111100ea2db7","observation_id":"f9c41a9e-8d14-489c-bbc6-a083d91002ad","resolution":{"observed_at":"2026-08-06T11:45:33.432068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.159008Z","title":"Google colab","venue":null,"work_id":"49005c9b-f232-4960-8f41-d7052938804e","year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.741242Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:480e63eaedaf9ba0d72d1bef066fb1e8658364c6a3e37322da02a62484b02267","observation_id":"be4e6da1-04ee-4dae-b684-914383a0f6be","resolution":{"observed_at":"2026-08-06T11:45:33.225486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:33.016805Z","title":null,"venue":null,"work_id":"636c048f-e598-4a16-b29b-cf301340faac","year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.744058Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f01a15bc758c46fa91c072cb6aa090c63cace0e9ea3a4ea3e55e04bba8c001ad","observation_id":"6cecf45d-a368-45a0-81ea-faceb5ae5d90","resolution":{"observed_at":"2026-08-06T11:45:33.089573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.889204Z","title":null,"venue":null,"work_id":"f71d7aa4-fcaf-4ac3-ac21-221e62f03dd8","year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.746884Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:72b37f624eae4fe6f7b79098561ae5ff2319b8aac58c88eaf809352a931931bc","observation_id":"ed0b236a-8c8e-4bd8-beb4-9c20b3a85238","resolution":{"observed_at":"2026-08-06T11:45:32.941399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.07657","last_updated":"2021-08-15T18:33:04Z","snapshot_observed_at":"2026-07-06T10:24:15.698595Z","submitted_at":"2020-12-14T15:53:56Z","title":"Lips Don't Lie: A Generalisable and Robust Approach to Face Forgery Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.07657","snapshot_observed_at":"2026-08-06T11:45:25.749720Z","title":"Lips don't lie: A generalisable and robust approach to face forgery detection, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.749720Z"},"links":{"cited_paper":"/paper/2012.07657","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c49ceb210929fee6a1e59396682ccab96b5d4e52eb4cd7b03228afe91f1797b7","observation_id":"476c3118-dcd6-4d90-99c4-09d305e0b016","resolution":{"observed_at":"2026-08-06T11:45:25.749720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.725306Z","title":"Deepfake detection using deep learning methods: A systematic and comprehensive review","venue":null,"work_id":"13989ba4-b179-4853-bd49-b674d1ba19d1","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.752836Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9a544c4eeb504806b6a22cd209a02696cfd13ceb8d5660a322cfe655feb42658","observation_id":"8e0abdf6-b301-4543-aa82-b193a0b61a78","resolution":{"observed_at":"2026-08-06T11:45:32.789728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-06T11:45:25.755888Z","title":"The curious case of neural text degeneration, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.755888Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9e45c399aa039f6d6fd99acd450d8b8052dc47f3896c255a19c59b3b62c7fdfe","observation_id":"1b3162eb-5743-476e-97a2-9ab79c3494cc","resolution":{"observed_at":"2026-08-06T11:45:25.755888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T11:45:25.758972Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.758972Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:0f2e98c3c5bd01a14f180f912046486f8a671ce90a1038997b1be090f707d306","observation_id":"c001dc96-f7c4-4acc-aa57-d697d71eecdb","resolution":{"observed_at":"2026-08-06T11:45:25.758972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.762668Z","title":"and Belongie, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.762668Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d6da4f970b928615f9ca90e2f9c1f39ab062f54c393f4f5424dd1cea6b81ce69","observation_id":"a6f9e54b-4d84-4425-aa38-09e32f66ee1c","resolution":{"observed_at":"2026-08-06T11:45:25.762668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.765541Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.765541Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9deb4511d23db7149ba27cf67227b079f176305a028a80a2dae3de91842c26da","observation_id":"3bbd3608-32ba-46d8-b746-c839e31c4661","resolution":{"observed_at":"2026-08-06T11:45:25.765541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-08-10T00:41:01.806631Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-06T11:45:25.769203Z","title":"Perceiver: General perception with iterative attention, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.769203Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:be819bf36fc85a2a0ef7262f77a6be7e8e7a0bc1b4deeed88212768d2d8ca7ba","observation_id":"5f1369a1-705e-40de-8d92-17e2d240420d","resolution":{"observed_at":"2026-08-06T11:45:25.769203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14077","last_updated":"2024-06-11T16:24:45Z","snapshot_observed_at":"2026-07-06T17:48:03.807374Z","submitted_at":"2024-03-21T01:57:30Z","title":"Can ChatGPT Detect DeepFakes? A Study of Using Multimodal Large Language Models for Media Forensics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14077","snapshot_observed_at":"2026-08-06T11:45:25.774011Z","title":"Can chatgpt detect deepfakes? a study of using multimodal large language models for media forensics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.774011Z"},"links":{"cited_paper":"/paper/2403.14077","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d69a66f0226924873a0cae7171a93d394e986f141e7e3e54d06d82bd2c8ac2a0","observation_id":"24010e10-2f9e-4ddb-8682-3aa945e3fea6","resolution":{"observed_at":"2026-08-06T11:45:25.774011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.593151Z","title":null,"venue":null,"work_id":"70abcbef-77bf-4da6-984b-d7c056f24ad5","year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.779652Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:82217f564888410d28995c82e25ec6dcfa23d15c67431668c0b8d638ca5e7e96","observation_id":"fe3c2745-697b-4979-a326-74f65fefdfff","resolution":{"observed_at":"2026-08-06T11:45:32.632587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.03024","last_updated":"2020-12-11T11:24:04Z","snapshot_observed_at":"2026-08-08T21:44:13.551788Z","submitted_at":"2020-01-09T14:37:17Z","title":"DeeperForensics-1.0: A Large-Scale Dataset for Real-World Face Forgery Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.03024","snapshot_observed_at":"2026-08-06T11:45:25.789130Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.789130Z"},"links":{"cited_paper":"/paper/2001.03024","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:16ac3f54fbfabdd42828760950ac7269b45c4e6c3fa8fbca201de1b425a0dea8","observation_id":"4ea0d829-ed47-4b90-ba33-908e6edc1354","resolution":{"observed_at":"2026-08-06T11:45:25.789130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-07-06T06:06:26.276752Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10196","snapshot_observed_at":"2026-08-06T11:45:25.798808Z","title":"Progressive growing of gans for improved quality, stability, and variation, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.798808Z"},"links":{"cited_paper":"/paper/1710.10196","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:809bb593decbebebd67dac42e48ff6b1ba4243ba74eec01efa3af301c41cde5f","observation_id":"4f5e0708-6e59-4baf-a4ad-6035e1081274","resolution":{"observed_at":"2026-08-06T11:45:25.798808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.809899Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.809899Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:fb64dc70570e09750efe25db3bfff37329f136d60c9de9880207191dd0c6af60","observation_id":"e2aa1969-782b-4ab3-9184-6fdbf7e8babb","resolution":{"observed_at":"2026-08-06T11:45:25.809899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13823","last_updated":"2023-06-13T21:54:58Z","snapshot_observed_at":"2026-07-06T14:46:41.380338Z","submitted_at":"2023-01-31T18:33:44Z","title":"Grounding Language Models to Images for Multimodal Inputs and Outputs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13823","snapshot_observed_at":"2026-08-06T11:45:25.821030Z","title":"Y., Salakhutdinov, R., and Fried, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.821030Z"},"links":{"cited_paper":"/paper/2301.13823","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:86cb751f1ea8bf98513c31b8c821215e447fea3fd582a50f47b87132629880ce","observation_id":"023256c2-59cf-4509-9605-53896f22f191","resolution":{"observed_at":"2026-08-06T11:45:25.821030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-08T17:33:57.727194Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-06T11:45:25.833109Z","title":"What matters when building vision-language models?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.833109Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ff860940b0c45e88cd43b92488f48c00d3e2393aeb5a3e6c63f9a6165a91088a","observation_id":"1baf0051-add2-4089-8741-eceb534f935e","resolution":{"observed_at":"2026-08-06T11:45:25.833109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.444359Z","title":"Why do facial deepfake detectors fail? In Proceedings of the 2nd Workshop on Security Implications of Deepfakes and Cheapfakes, pp.\\ 24--28, 2023","venue":null,"work_id":"3bbc011b-25a8-40b4-9aaa-60216af40cd7","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.837613Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:6cae52239b95987beca05ff78dffe2374c8272779b91aed6805f535676d6809d","observation_id":"873d2fc7-9d1a-4d96-b1cd-a5e4c6858068","resolution":{"observed_at":"2026-08-06T11:45:32.501558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.03553","last_updated":"2021-12-07T07:58:28Z","snapshot_observed_at":"2026-08-09T07:38:35.108574Z","submitted_at":"2021-12-07T07:58:28Z","title":"ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images","version":1},"cited_work":{"arxiv_id":"2112.03553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.03553","snapshot_observed_at":"2026-08-06T11:45:29.597661Z","title":"ADD: Frequency Attention and Multi-View based Knowledge Distillation to Detect Low-Quality Compressed Deepfake Images","venue":"cs.CV","work_id":"1c1762d8-1963-47ef-a6be-c8769b323893","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.843303Z"},"links":{"cited_paper":"/paper/2112.03553","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:a6b5551768471c58dce3cf33499995f0257c8bab96feb8c5d239650be7c10bac","observation_id":"c1786cf5-8db9-4569-b38c-bcbf41ffaa1e","resolution":{"observed_at":"2026-08-06T11:45:29.686144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05911","last_updated":"2023-09-12T02:01:31Z","snapshot_observed_at":"2026-08-05T14:05:50.537550Z","submitted_at":"2023-09-12T02:01:31Z","title":"Quality-Agnostic Deepfake Detection with Intra-model Collaborative Learning","version":1},"cited_work":{"arxiv_id":"2309.05911","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05911","snapshot_observed_at":"2026-08-06T11:45:29.439208Z","title":"Quality-Agnostic Deepfake Detection with Intra-model Collaborative Learning","venue":"cs.CV","work_id":"2da2087b-b093-4b55-a291-ed959f5616d0","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.851771Z"},"links":{"cited_paper":"/paper/2309.05911","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:703e687c05530c20f7cc516931a9ad7e531ed1fa97c3d89c59d20d1dd9f740d6","observation_id":"2144c11a-1e7a-471a-b944-a6a88d556c84","resolution":{"observed_at":"2026-08-06T11:45:29.508268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04364","last_updated":"2025-03-02T02:32:25Z","snapshot_observed_at":"2026-07-06T17:13:08.935785Z","submitted_at":"2024-01-09T05:32:22Z","title":"SoK: Systematization and Benchmarking of Deepfake Detectors in a Unified Framework","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04364","snapshot_observed_at":"2026-08-06T11:45:25.863676Z","title":"M., Kim, J., Tariq, S., Moore, K., Abuadbba, A., and Woo, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.863676Z"},"links":{"cited_paper":"/paper/2401.04364","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:fe576cf895eb9748ff71d40ac3cedcf9e5c8b4e4a1ba1b0e0ee9608b3166adf5","observation_id":"c24bd814-709e-4af0-8fdc-4b0ca17eda71","resolution":{"observed_at":"2026-08-06T11:45:25.863676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12086","last_updated":"2022-02-15T05:43:32Z","snapshot_observed_at":"2026-08-09T08:39:37.884261Z","submitted_at":"2022-01-28T12:49:48Z","title":"BLIP: Bootstrapping Language-Image Pre-training for Unified Vision-Language Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12086","snapshot_observed_at":"2026-08-06T11:45:25.877668Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.877668Z"},"links":{"cited_paper":"/paper/2201.12086","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:56ce7e3153ad639b527e6a2b5eb1ba93ecb7c02135aa15579031fbeef6c840dc","observation_id":"ed8c2d38-64ab-4837-a083-f34616d960c3","resolution":{"observed_at":"2026-08-06T11:45:25.877668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-06T11:45:25.889383Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.889383Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8d29ce1753e8b95999ddd1cefee3579bead38cf16722ff64d2c48f84b38bb5d6","observation_id":"e1e77963-6d23-4f0a-b758-3e67b2ed4824","resolution":{"observed_at":"2026-08-06T11:45:25.889383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13457","last_updated":"2020-09-15T07:43:58Z","snapshot_observed_at":"2026-08-08T08:09:14.122603Z","submitted_at":"2019-12-31T17:57:46Z","title":"FaceShifter: Towards High Fidelity And Occlusion Aware Face Swapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13457","snapshot_observed_at":"2026-08-06T11:45:25.901767Z","title":"Faceshifter: Towards high fidelity and occlusion aware face swapping","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.901767Z"},"links":{"cited_paper":"/paper/1912.13457","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:868ce48f1aa80c914ef8a9b9f88d6af97150b44ae062adcc17dcf488b8855a91","observation_id":"36db16bf-6175-4ae9-b121-c67e21cdd468","resolution":{"observed_at":"2026-08-06T11:45:25.901767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12962","last_updated":"2020-03-16T16:20:16Z","snapshot_observed_at":"2026-08-09T21:40:08.213399Z","submitted_at":"2019-09-27T21:26:34Z","title":"Celeb-DF: A Large-scale Challenging Dataset for DeepFake Forensics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12962","snapshot_observed_at":"2026-08-06T11:45:25.914487Z","title":"Celeb-df: A large-scale challenging dataset for deepfake forensics, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.914487Z"},"links":{"cited_paper":"/paper/1909.12962","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:35f19dbc45e58c5bd5dec0f9dd1a81ed70b3f2b6a51bc67a85090b9814996d03","observation_id":"606c5138-2cf8-44d8-9ca0-55a6f0032203","resolution":{"observed_at":"2026-08-06T11:45:25.914487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13306","last_updated":"2024-09-08T12:07:52Z","snapshot_observed_at":"2026-08-07T20:34:56.945035Z","submitted_at":"2024-04-20T07:28:55Z","title":"FakeBench: Probing Explainable Fake Image Detection via Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13306","snapshot_observed_at":"2026-08-06T11:45:25.927366Z","title":"Fakebench: Uncover the achilles' heels of fake images with large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.927366Z"},"links":{"cited_paper":"/paper/2404.13306","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3af6aaebc789f87413561e77cc11db249145f2f7e1dfa32197b1dd174bed3fb8","observation_id":"996d382f-c1f8-4f29-8a5c-71f8774efeb0","resolution":{"observed_at":"2026-08-06T11:45:25.927366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1405.0312","last_updated":"2015-02-21T01:48:49Z","snapshot_observed_at":"2026-07-06T03:42:37.507458Z","submitted_at":"2014-05-01T21:43:32Z","title":"Microsoft COCO: Common Objects in Context","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1405.0312","snapshot_observed_at":"2026-08-06T11:45:25.938042Z","title":"L., and Dollár, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.938042Z"},"links":{"cited_paper":"/paper/1405.0312","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:9aa6ad75414eedd8dc5bf4df46ceb6a193ea3eebaa2b37e3ad7a03155c4d0643","observation_id":"0cf3b36d-95ea-4b86-a22c-14056a2d00d8","resolution":{"observed_at":"2026-08-06T11:45:25.938042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T11:45:25.943440Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.943440Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:8771fa89ad4fea56828f706cfe1deeb4361beb59dc2dfe32c854529fcd57121a","observation_id":"cdd91f71-5351-4fcd-b5ae-b8fd53c40d37","resolution":{"observed_at":"2026-08-06T11:45:25.943440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-06T11:45:25.948778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.948778Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:85cafcf58b6c0dfbc4282f00e00749b9ed650740035614c57c6063609459b2bb","observation_id":"c501240a-4cca-4e0c-829a-ec230b320b43","resolution":{"observed_at":"2026-08-06T11:45:25.948778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:25.954993Z","title":"Few-shot unsupervised image-to-image translation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.954993Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:f378a3e9079becbb911b0829feac1eb0753ca2b4ec69a944e4ddcd56753c5918","observation_id":"631ab8f8-0e07-46cf-9371-b5c8d1eb3843","resolution":{"observed_at":"2026-08-06T11:45:25.954993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06965","last_updated":"2025-04-03T07:47:44Z","snapshot_observed_at":"2026-07-06T18:28:38.016649Z","submitted_at":"2024-06-11T05:48:04Z","title":"Evolving from Single-modal to Multi-modal Facial Deepfake Detection: Progress and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06965","snapshot_observed_at":"2026-08-06T11:45:25.964923Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:25.964923Z"},"links":{"cited_paper":"/paper/2406.06965","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d066e0e507ae04a63c29dba063ecc647c4f6dfaf16045d0fe3168a5cbc07e7ef","observation_id":"f2da1ff6-0ed7-4b07-b2b5-e1504fdbd827","resolution":{"observed_at":"2026-08-06T11:45:25.964923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T11:45:26.074973Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.074973Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:b63862a35963eccd09d04446d46a9de2bd38855b0de3a462429a26fd505808e8","observation_id":"76fd7a13-8000-4891-b1a5-b0bed43d032a","resolution":{"observed_at":"2026-08-06T11:45:26.074973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.328280Z","title":"Fooocus-inswapper","venue":null,"work_id":"3688d94a-43b8-4b89-94ce-8d28d97eb7f0","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.125985Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:454f3993a2b36385bf6b157b80660928224a6c52e6062de2ff99449b19a5fb76","observation_id":"bb2d4660-7db9-4f29-8878-8f7f4573df07","resolution":{"observed_at":"2026-08-06T11:45:32.390904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11215","last_updated":"2018-10-26T07:50:29Z","snapshot_observed_at":"2026-07-06T07:10:45.055300Z","submitted_at":"2018-10-26T07:50:29Z","title":"Capsule-Forensics: Using Capsule Networks to Detect Forged Images and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.11215","snapshot_observed_at":"2026-08-06T11:45:26.202575Z","title":"H., Yamagishi, J., and Echizen, I","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.202575Z"},"links":{"cited_paper":"/paper/1810.11215","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2ab4f5afa7c9f67d60cdbf2c32fc0662a04605ef2999ba90712824148f8685ab","observation_id":"064f268a-0ad8-4701-91ee-f6a3e1b5aa67","resolution":{"observed_at":"2026-08-06T11:45:26.202575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.194514Z","title":"FSGAN : Subject agnostic face swapping and reenactment","venue":null,"work_id":"6dc5f3f3-61df-4801-b44b-c01db5e8a98f","year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.280102Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e8296d6b5647741899f297fd4f69353e8886c49ce00c59a71e6e0be8396c7619","observation_id":"581ba759-aa66-46fc-a5b2-70c0b24226bb","resolution":{"observed_at":"2026-08-06T11:45:32.259174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:32.066316Z","title":"Fsganv2: Improved subject agnostic face swapping and reenactment","venue":null,"work_id":"9ad2e7e2-34a4-4ca4-b9a1-2a136cfd66f8","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.330327Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:edd3ec089a89a7634226b8cd186d2cd023b83dc29149c97cdc39be3b44ce0bd8","observation_id":"2e08be8a-56bb-4e43-b094-e8cfd1618678","resolution":{"observed_at":"2026-08-06T11:45:32.100286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.914888Z","title":"Introducing chatgpt","venue":null,"work_id":"27eb4a10-4a41-4908-b15e-3a4e749290b8","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.359014Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:a721582463609ecadc396a46710c7afd1db9fb1931ceb630753582d1ca86de28","observation_id":"db642755-0f83-40e3-8fe4-4ec1faf97c69","resolution":{"observed_at":"2026-08-06T11:45:32.014403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.05535","last_updated":"2021-06-29T07:07:57Z","snapshot_observed_at":"2026-08-05T10:35:32.217815Z","submitted_at":"2020-05-12T03:26:55Z","title":"DeepFaceLab: Integrated, flexible and extensible face-swapping framework","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.05535","snapshot_observed_at":"2026-08-06T11:45:26.439544Z","title":"S., RP, L., Jiang, J., et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.439544Z"},"links":{"cited_paper":"/paper/2005.05535","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:1612130d097edddf5838ea670eed7df6b7ff20563b62ca90331c55f94157553d","observation_id":"d1aa9c40-b75d-485c-8c1f-c4007b004385","resolution":{"observed_at":"2026-08-06T11:45:26.439544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21905","last_updated":"2025-08-04T13:19:11Z","snapshot_observed_at":"2026-08-10T07:48:16.146839Z","submitted_at":"2025-07-29T15:17:00Z","title":"Evaluating Deepfake Detectors in the Wild","version":2},"cited_work":{"arxiv_id":"2507.21905","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.21905","snapshot_observed_at":"2026-08-06T11:45:29.115849Z","title":"Evaluating Deepfake Detectors in the Wild","venue":"cs.CV","work_id":"68c6c6b6-a590-4035-80bf-6fe5bf44cbe8","year":2025},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.498459Z"},"links":{"cited_paper":"/paper/2507.21905","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:08843976b97fdadece178effd8289965060a1c06e854759e6827e9031c40b3a0","observation_id":"33751ec3-8a2c-4f31-ad8a-6747091f1f93","resolution":{"observed_at":"2026-08-06T11:45:29.158094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.09355","last_updated":"2020-10-27T04:04:29Z","snapshot_observed_at":"2026-07-06T09:39:21.915461Z","submitted_at":"2020-07-18T07:39:08Z","title":"Thinking in Frequency: Face Forgery Detection by Mining Frequency-aware Clues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.09355","snapshot_observed_at":"2026-08-06T11:45:26.632123Z","title":"Thinking in frequency: Face forgery detection by mining frequency-aware clues, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.632123Z"},"links":{"cited_paper":"/paper/2007.09355","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e50469f624f5e9ae6c8ba31be0521b4489806e7d4f228acfa7e6090d20e578c5","observation_id":"f92bcbd5-5b25-464d-817f-ace6d45dfcc0","resolution":{"observed_at":"2026-08-06T11:45:26.632123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T11:45:26.709415Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.709415Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:3637d5db43c64a09245e11527867f08eb2d5e951301e01dc23d955305566d893","observation_id":"bd5085ee-21ed-4f5f-a7b2-d8558e971fa0","resolution":{"observed_at":"2026-08-06T11:45:26.709415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14571","last_updated":"2024-01-22T07:24:58Z","snapshot_observed_at":"2026-07-06T14:10:36.326803Z","submitted_at":"2022-10-26T09:01:19Z","title":"Towards the Detection of Diffusion Model Deepfakes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14571","snapshot_observed_at":"2026-08-06T11:45:26.801372Z","title":"Towards the detection of diffusion model deepfakes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.801372Z"},"links":{"cited_paper":"/paper/2210.14571","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:1324cbd0c456b4958ec1baf8b422fd65618ef1d7948f9045ebdbd24ad52fe93f","observation_id":"ccdb35f6-3104-4fad-9ed3-3bf5dbd09092","resolution":{"observed_at":"2026-08-06T11:45:26.801372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.807145Z","title":"Faceforensics++: Learning to detect manipulated facial images","venue":null,"work_id":"2957e3a8-c028-4312-9ecb-d13cbd5602f0","year":2019},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.901204Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:5c8ffe25f3ec25480a83327e1315e0b3d42e1ec1cac42a59976ad5203844e85b","observation_id":"ca7f0598-1c21-4f49-9ebc-54636cc792c2","resolution":{"observed_at":"2026-08-06T11:45:31.860567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.640049Z","title":null,"venue":null,"work_id":"aba1412c-7924-4894-bd5b-c3d5ebb0b597","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:26.971110Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:861265a21aa515f93248b505237c9be1c47baa5ed32f438f520a777c2ec85073","observation_id":"89ef0a4a-58d0-4d95-9dd6-5493dc68dff5","resolution":{"observed_at":"2026-08-06T11:45:31.706159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.500941Z","title":null,"venue":null,"work_id":"6e1294ec-e198-45a9-a47f-1e0e8a90ab39","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.044896Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:643f856cb7b2b29fc5501a8b62179872a2e1739ec6070f52c6cdaf93bf3a320a","observation_id":"70d74ecb-469d-4760-a5de-5d403bb00f20","resolution":{"observed_at":"2026-08-06T11:45:31.569019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.366692Z","title":"Roop for stablediffusion","venue":null,"work_id":"cd3ef592-e667-4c85-9b40-fff9d5f995e5","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.111281Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:08992f7d3ff4e440520798098f0fcf14dee95d198935c54e5804de84e3fa5924","observation_id":"8da331f3-dbfb-458c-bdb3-a00c3f153202","resolution":{"observed_at":"2026-08-06T11:45:31.428041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04178","last_updated":"2025-04-19T05:46:00Z","snapshot_observed_at":"2026-08-09T11:46:55.947071Z","submitted_at":"2024-02-06T17:31:36Z","title":"SHIELD : An Evaluation Benchmark for Face Spoofing and Forgery Detection with Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04178","snapshot_observed_at":"2026-08-06T11:45:27.190125Z","title":"Shield : An evaluation benchmark for face spoofing and forgery detection with multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.190125Z"},"links":{"cited_paper":"/paper/2402.04178","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:b2c25f7afefba2ecbf089079bf267047f8211f86ed5e169ea7d1c1da9ec2dc1e","observation_id":"122db774-57d1-4d8f-89b3-effffe2f5bc6","resolution":{"observed_at":"2026-08-06T11:45:27.190125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.200163Z","title":"and Yamasaki, T","venue":null,"work_id":"5865a953-315c-4bae-b9e1-1d6d47cbfb59","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.273097Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e2628708332e0d0a4604984ceadd31923b5f748f8e546b1d760e0aacd3347bb7","observation_id":"64b52fa6-2b9d-43ce-8700-ff621625e2f3","resolution":{"observed_at":"2026-08-06T11:45:31.281946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:31.063066Z","title":"Adaptive face forgery detection in cross domain","venue":null,"work_id":"aadaf3f2-4146-4a19-afc0-59d04e0277ab","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.387175Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:665333e9f78364c2c4faf90bb28ce229fcfa4cf410b2f142b0e1b99b4f642c81","observation_id":"f056eaa5-f34c-492e-88fd-0efcd9cf4eeb","resolution":{"observed_at":"2026-08-06T11:45:31.118386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.950707Z","title":"Fraud report 2024","venue":null,"work_id":"7d3ab030-91ed-45f7-be74-b133a40d80b6","year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.407631Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:7fbcca6b3b5a0460e469196ed57b52f697e6222a2992782a27db793dc27e2b4b","observation_id":"edb631dc-2b45-49da-a226-7e20bd135df4","resolution":{"observed_at":"2026-08-06T11:45:30.996970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i3.16367","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Domain general face forgery detection by learning to weight","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"dfaf611b-02aa-4a3a-a7e1-5e567fd6aa04","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.489858Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2d857a4f0bd3ec4cc86e3759f763ebb2b6318577179df62440eabce82ea62212","observation_id":"be557504-c761-459d-8f67-7c4e1c4a3be6","resolution":{"observed_at":"2026-08-06T11:45:28.584047Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13522","last_updated":"2021-12-27T05:44:40Z","snapshot_observed_at":"2026-08-03T19:40:12.454695Z","submitted_at":"2021-12-27T05:44:40Z","title":"Dual Contrastive Learning for General Face Forgery Detection","version":1},"cited_work":{"arxiv_id":"2112.13522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.13522","snapshot_observed_at":"2026-08-06T11:45:28.933919Z","title":"Dual Contrastive Learning for General Face Forgery Detection","venue":"cs.CV","work_id":"ee8b2983-efa9-412a-9119-969089b6b09c","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.567870Z"},"links":{"cited_paper":"/paper/2112.13522","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:864091e09a659705914aac29c4443d12096e208a39c816fb26bc28d08a10b195","observation_id":"51bca2af-f6cf-4721-be78-48c4e8a13c70","resolution":{"observed_at":"2026-08-06T11:45:29.000170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16545","last_updated":"2024-02-07T07:52:10Z","snapshot_observed_at":"2026-08-10T07:41:15.287944Z","submitted_at":"2023-07-31T10:22:33Z","title":"Towards General Visual-Linguistic Face Forgery Detection","version":2},"cited_work":{"arxiv_id":"2307.16545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.16545","snapshot_observed_at":"2026-08-06T11:45:28.808353Z","title":"Towards General Visual-Linguistic Face Forgery Detection","venue":"cs.CV","work_id":"8ec9e262-d509-4660-bb05-3c35c3b66be6","year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.637771Z"},"links":{"cited_paper":"/paper/2307.16545","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d8497f968a7d84147c8e39244249c1c86a0fcccbf98c9fcdfa3883915282bd0d","observation_id":"3242dacc-bdc1-486f-b0c9-dcd10431dfe6","resolution":{"observed_at":"2026-08-06T11:45:28.846168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:27.732169Z","title":"One detector to rule them all: Towards a general deepfake attack detection framework","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.732169Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:2f12f0545c0164d6c22016503351d1971e9df08a8f9e90e149389e29fbe6fc01","observation_id":"3e93d223-f7f7-4b26-a4c5-f38dde8a10f4","resolution":{"observed_at":"2026-08-06T11:45:27.732169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T11:45:27.765687Z","title":"Gemini: A family of highly capable multimodal models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.765687Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:c1a275e5ceed1702089b81bd671068da5075ebb8abec9a42f8e4ed89a0cfab01","observation_id":"fed6a2f4-8f47-4efe-998d-c09bc89ce5ff","resolution":{"observed_at":"2026-08-06T11:45:27.765687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T11:45:27.834401Z","title":"Gpt-4 technical report, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.834401Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:4b71759a7c38af57396adcf3c3aaa1619cc3f546fba9510b0353ec24950f52be","observation_id":"e797c0e1-2da1-41fe-9ec7-02a7f135025d","resolution":{"observed_at":"2026-08-06T11:45:27.834401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:27.912205Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.912205Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:30985d20b6a016819b476be955f6dd0b5d7f122219f39e0f66ca65045c0a29bb","observation_id":"6b9e6bf8-f24e-49ac-878b-58e01ebc5c4c","resolution":{"observed_at":"2026-08-06T11:45:27.912205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.820947Z","title":"M2tr: Multi-modal multi-scale transformers for deepfake detection","venue":null,"work_id":"2c763fd1-a784-46db-8e8f-e649c7b44d97","year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.938985Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:e4fb94032f036147e1e34a78afbc526e01ba11a4ba22c921c32835df50eb7a79","observation_id":"033ec6ec-0010-48b7-b332-bde310235ddd","resolution":{"observed_at":"2026-08-06T11:45:30.853215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-06T11:45:27.994616Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:27.994616Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:66bf08ba8e2d0dc88390534445078d817c9f25e765ba793e5e45f1d47682a493","observation_id":"cd3f2ce5-148b-4507-b408-577e93957ad0","resolution":{"observed_at":"2026-08-06T11:45:27.994616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.689833Z","title":"Few-shot classification with feature map reconstruction networks","venue":null,"work_id":"fa66d91c-ee10-4988-841f-fc0f70d48c19","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.087381Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:ba05e3bf2628fada822f66edf8a2c7191930faa69d2fedc957d75484a5c0efd7","observation_id":"e5e3ceea-3043-4d6a-98e6-93a516439731","resolution":{"observed_at":"2026-08-06T11:45:30.738678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09193","last_updated":"2023-11-15T18:39:21Z","snapshot_observed_at":"2026-08-10T05:47:40.489627Z","submitted_at":"2023-11-15T18:39:21Z","title":"The Role of Chain-of-Thought in Complex Vision-Language Reasoning Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09193","snapshot_observed_at":"2026-08-06T11:45:28.127701Z","title":"C., and Nie, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.127701Z"},"links":{"cited_paper":"/paper/2311.09193","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:51876424f932ace78f763093d017841ae81c3558a8ef3e66ee0091779d860775","observation_id":"a19da922-fc32-42d2-91b9-f0850cb05a4b","resolution":{"observed_at":"2026-08-06T11:45:28.127701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-06T11:45:28.242603Z","title":"Hallucination is inevitable: An innate limitation of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.242603Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:d7c4fcff70445c58b26399f530ec2bbb6b83e08831714a75af1bef8521a6d718","observation_id":"2ce05cdf-f5ef-464c-98cd-7653e1b92e5b","resolution":{"observed_at":"2026-08-06T11:45:28.242603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T11:45:28.288418Z","title":"Coca: Contrastive captioners are image-text foundation models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.288418Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:44038bbe788e2486dd5e76250e61e17600961c1a8f3d2a4c39dc57346a2fa580","observation_id":"015561f2-1b4b-4833-8f37-51bee7b415cc","resolution":{"observed_at":"2026-08-06T11:45:28.288418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00126","last_updated":"2024-07-18T07:59:36Z","snapshot_observed_at":"2026-08-07T17:25:22.476729Z","submitted_at":"2024-01-31T19:11:58Z","title":"Common Sense Reasoning for Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00126","snapshot_observed_at":"2026-08-06T11:45:28.334369Z","title":"Common sense reasoning for deep fake detection, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.334369Z"},"links":{"cited_paper":"/paper/2402.00126","citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:0fd080fd3e87fe9156bfe359a108fc95f343dee2146d154fcc46ae7821a9fc2c","observation_id":"8ea7e7c9-e6d1-45e1-b5f2-89e8f7455b46","resolution":{"observed_at":"2026-08-06T11:45:28.334369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:45:30.607853Z","title":"Multi-attentional deepfake detection","venue":null,"work_id":"26eebd2b-6087-439c-a22d-8f3c01ce5968","year":2021},"citing_paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T11:45:28.405188Z"},"links":{"citing_paper":"/paper/2507.22469"},"observation_digest":"sha256:41131f9653c5f14188513ba47cece59914683674694376a718db8887d57f1b33","observation_id":"cb7fd093-b6b8-40de-988b-423837addb8b","resolution":{"observed_at":"2026-08-06T11:45:30.657639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22469","last_updated":"2025-07-30T08:20:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T04:48:35.245329Z","submitted_at":"2025-07-30T08:20:02Z","title":"Visual Language Models as Zero-Shot Deepfake Detectors"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":9,"verified_fuzzy":17},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2507.22469."}