{"as_of":"2026-08-09T20:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e87a1bcc138f552c7ee9d17efc39ac2da71c1d30e7ef769a837dd2bc2d051140","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:25:17.797045Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15321/citation-record","integrity":"/paper/2607.15321/integrity","json":"/paper/2607.15321/citation-record.json","paper":"/paper/2607.15321"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:13.663746Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:13.663746Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:63283528a11f1c4acbf9115bda642aec6f2ef189fbba4ae950681be46d92857a","observation_id":"191cdb13-2a8e-46d8-a6da-bb1d72c8f958","resolution":{"observed_at":"2026-08-02T01:25:13.663746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-02T01:25:13.826214Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers.arXiv preprint arXiv:2205.15868, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:13.826214Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:3605b4eb947cadcaa85e4b0142d744fe37289262cdec02733bd46090506aa8b6","observation_id":"39ed1b31-457c-4611-8756-dd3a60610d22","resolution":{"observed_at":"2026-08-02T01:25:13.826214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-02T01:25:13.931554Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:13.931554Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:d2728bfd0f8070afcd0c831ce7bba93624203f92c14772aca2548f739ed527d9","observation_id":"f88481bb-7dd4-4de8-8135-58cc0b351bab","resolution":{"observed_at":"2026-08-02T01:25:13.931554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-02T01:25:14.049045Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.049045Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:4f737dbf2efcda447985778c4fb257aaefd4deeb32ac77c7a6244dfba3e5bec0","observation_id":"3527d7f8-13c1-4234-b400-81c077b1bd01","resolution":{"observed_at":"2026-08-02T01:25:14.049045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-02T01:25:14.151599Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.151599Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:842e277115fbbcc5b6f14ea6e929a92ceeb9e01e81f998920fa7f1747ed8c327","observation_id":"2bf3b855-16ca-4b8f-93b2-692800758272","resolution":{"observed_at":"2026-08-02T01:25:14.151599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T01:25:14.268731Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.268731Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:4d6017a3ac4fab309394ee09a613b85738d312df416dfdfcfb3879f3c67e2f63","observation_id":"7c015a18-15d9-4ae3-b72d-fa0d4c312447","resolution":{"observed_at":"2026-08-02T01:25:14.268731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19707","last_updated":"2024-08-22T09:48:49Z","snapshot_observed_at":"2026-08-09T19:18:25.791123Z","submitted_at":"2024-05-30T05:36:12Z","title":"DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19707","snapshot_observed_at":"2026-08-02T01:25:14.382378Z","title":"Demamba: Ai-generated video detection on million-scale genvideo benchmark.arXiv preprint arXiv:2405.19707, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.382378Z"},"links":{"cited_paper":"/paper/2405.19707","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:394bb7599db431ce043ce5103e9f47c257939b4298c2d3b6709c460dbf799587","observation_id":"a324ac29-6902-4111-9d6a-6424eabdeb52","resolution":{"observed_at":"2026-08-02T01:25:14.382378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:14.491837Z","title":"Ai-generated video detection via spatial-temporal anomaly learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.491837Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:24093b27897c6770615ea713d6a678468aa006b26d09de7a137af4ac24d54e80","observation_id":"410ed781-e232-4db9-a7a0-e19999bf62d6","resolution":{"observed_at":"2026-08-02T01:25:14.491837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09601","last_updated":"2024-06-13T21:52:49Z","snapshot_observed_at":"2026-08-09T15:52:43.609003Z","submitted_at":"2024-06-13T21:52:49Z","title":"Turns Out I'm Not Real: Towards Robust Detection of AI-Generated Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09601","snapshot_observed_at":"2026-08-02T01:25:14.591528Z","title":"Turns out i’m not real: Towards robust detection of ai-generated videos.arXiv preprint arXiv:2406.09601, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.591528Z"},"links":{"cited_paper":"/paper/2406.09601","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:29cbe6443647ab63738c5ee0ac329bef174e8e777620ceabdbc366c31455ce20","observation_id":"e0bae2fb-e9d7-4708-b3c4-23ed58233d0c","resolution":{"observed_at":"2026-08-02T01:25:14.591528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:14.690565Z","title":"Training-free detection of generated videos via spatial-temporal likelihoods.arXiv preprint arXiv:2603.15026, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.690565Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:d0c41ee8456c5df823f874e893f3433f88ca87a38867e4f1ea4a728c0ab267d5","observation_id":"74bc3ff7-49ed-440c-8d4c-d2234cf0cec4","resolution":{"observed_at":"2026-08-02T01:25:14.690565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:14.767515Z","title":"Rethink- ing the up-sampling operations in cnn-based generative network for generalizable deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.767515Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:930074fe19d55eabdc7b723552ea43f07b9d77b6c55830e9889298ebb607608b","observation_id":"d382c04a-8dc4-4aa2-acb2-9006063537b5","resolution":{"observed_at":"2026-08-02T01:25:14.767515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:14.853418Z","title":"Dual data alignment makes ai-generated image detector easier generalizable.arXiv preprint arXiv:2505.14359, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.853418Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:418a77f9e4d8af7380357a0c87941d1f2d53bde416741301402ba338a0202ebf","observation_id":"153446c9-2862-4f23-9b7c-b6b19f0088b6","resolution":{"observed_at":"2026-08-02T01:25:14.853418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15633","last_updated":"2025-05-20T12:06:56Z","snapshot_observed_at":"2026-08-06T14:53:33.853203Z","submitted_at":"2024-11-23T19:10:32Z","title":"Orthogonal Subspace Decomposition for Generalizable AI-Generated Image Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15633","snapshot_observed_at":"2026-08-02T01:25:14.912439Z","title":"Orthogonal subspace decomposition for generalizable ai-generated image detection.arXiv preprint arXiv:2411.15633, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.912439Z"},"links":{"cited_paper":"/paper/2411.15633","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:c808fd54505895579bc33ae1bd33a345966fc6cd2a1a02d24cc21cd7fc61a3c2","observation_id":"222e32dd-0f29-49ca-8ef9-10be9f460452","resolution":{"observed_at":"2026-08-02T01:25:14.912439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:14.973993Z","title":"Your one-stop solution for ai-generated video detection.arXiv preprint arXiv:2601.11035, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:14.973993Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:2f4157c98b16b5ca7734d941bab3d5baefe5f0503c1c44bcfe24557c8baae473","observation_id":"20ab9315-31a3-4842-87a6-14c7c520e806","resolution":{"observed_at":"2026-08-02T01:25:14.973993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08073","last_updated":"2026-06-10T11:00:38Z","snapshot_observed_at":"2026-08-04T10:54:17.464105Z","submitted_at":"2025-10-09T11:00:35Z","title":"Physics-Driven Spatiotemporal Modeling for AI-Generated Video Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08073","snapshot_observed_at":"2026-08-02T01:25:15.036619Z","title":"Physics-driven spatiotemporal modeling for ai-generated video detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.036619Z"},"links":{"cited_paper":"/paper/2510.08073","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:6007ebdf74d35243a07e96c266debe7db98f7f58e6aefb82310564cad225f33e","observation_id":"e0de16d3-6dc9-4b9c-80c8-20bc02f8a2d3","resolution":{"observed_at":"2026-08-02T01:25:15.036619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:15.102344Z","title":"Beyond spatial frequency: Pixel-wise temporal frequency-based deepfake video detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.102344Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:2447b8460b557b2b85d4a0e856cfbfd48f3c06244c429d92003f65f101592740","observation_id":"b82ecf64-65ec-46c8-887c-6a4e2118f2cb","resolution":{"observed_at":"2026-08-02T01:25:15.102344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:15.227601Z","title":"What matters in detecting ai-generated videos like sora?arXiv e-prints, pages arXiv–2406, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.227601Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:a5359977c694c17b69d361a33c1a014b8b65c6e0d1bf65efdf672c8889e9ab1d","observation_id":"477281dc-347a-4ae7-add4-0846084383ff","resolution":{"observed_at":"2026-08-02T01:25:15.227601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:15.361993Z","title":"Detecting ai-generated video via frame consistency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.361993Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:49e98a7b236d670722b0e74bfbae99cc014b272b1bb1ccb9da38d4db7cd41ccc","observation_id":"8252c518-457e-446d-a856-cc8c6ca48c1e","resolution":{"observed_at":"2026-08-02T01:25:15.361993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15693","last_updated":"2026-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:48:26Z","title":"Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15693","snapshot_observed_at":"2026-08-02T01:25:15.513604Z","title":"Skyra: Ai-generated video detection via grounded artifact reasoning.arXiv preprint arXiv:2512.15693, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.513604Z"},"links":{"cited_paper":"/paper/2512.15693","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:44fc3077e5732093733859b383508e59959c26b186a9d0258bc601490fc0c076","observation_id":"631c6b51-616a-4686-9d42-04fcb96efbdb","resolution":{"observed_at":"2026-08-02T01:25:15.513604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00979","last_updated":"2026-05-05T13:47:19Z","snapshot_observed_at":"2026-07-06T21:34:34.091508Z","submitted_at":"2025-06-01T12:20:22Z","title":"Ivy-Fake: A Unified Explainable Framework and Benchmark for Image and Video AIGC Detection","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00979","snapshot_observed_at":"2026-08-02T01:25:15.641483Z","title":"Ivy-fake: A unified explainable framework and benchmark for image and video aigc detection.arXiv preprint arXiv:2506.00979, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.641483Z"},"links":{"cited_paper":"/paper/2506.00979","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:9518c80f168b6289514bcd49b3188cdc30ab8ec682fd81ab4d5ba3399f225591","observation_id":"32c5e849-d8b9-4c81-9a4e-be8cb3f73bd3","resolution":{"observed_at":"2026-08-02T01:25:15.641483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00874","last_updated":"2025-06-01T07:20:45Z","snapshot_observed_at":"2026-08-07T11:53:46.785764Z","submitted_at":"2025-06-01T07:20:45Z","title":"Breaking Latent Prior Bias in Detectors for Generalizable AIGC Image Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00874","snapshot_observed_at":"2026-08-02T01:25:15.742028Z","title":"Breaking latent prior bias in detectors for generalizable aigc image detection.arXiv preprint arXiv:2506.00874, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.742028Z"},"links":{"cited_paper":"/paper/2506.00874","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:068e5f852f9c31d75a72a1f95303bb4892a40dc64bd860374e5c45ff135dc7d5","observation_id":"7db9e251-8725-4afc-9d29-6b1cff75bc35","resolution":{"observed_at":"2026-08-02T01:25:15.742028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:15.855031Z","title":"Gc-consflow: Leveraging optical flow residuals and global context for robust deepfake detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.855031Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:f922f0a321b769f53ab51c16d17fbcaf5339ffe0ed010f395d51083b2a5ab0ed","observation_id":"717e4620-e4a1-45d1-b768-8a479786dc5f","resolution":{"observed_at":"2026-08-02T01:25:15.855031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:15.983929Z","title":"Thinking in frequency: Face forgery detection by mining frequency-aware clues","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:15.983929Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:fe7aba3549da7d20b97e5ec17218bf4c7643313609fdd729849b63b2654ee431","observation_id":"b7ea448b-f819-4ca3-b5a6-08ee38471556","resolution":{"observed_at":"2026-08-02T01:25:15.983929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.072698Z","title":"Cinemae: Leveraging frozen masked autoencoders for cross-generator ai image detection.arXiv preprint arXiv:2511.06325, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.072698Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:ff01f180adedc32765b40e0bd9e8dd821ca42156e7666cb8540fd994bb4c9151","observation_id":"218a587c-3b7c-4786-97d6-033442369e00","resolution":{"observed_at":"2026-08-02T01:25:16.072698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.181583Z","title":"Towards universal fake image detectors that generalize across generative models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.181583Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:35dee04f75e8af3767efcc4fd2995174de3d626be630fb44f198dd345bdd4c69","observation_id":"ab625921-8035-4a23-9189-703f51cc8e33","resolution":{"observed_at":"2026-08-02T01:25:16.181583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.278537Z","title":"Mirror: Manifold ideal reference reconstructor for generalizable ai-generated image detection.arXiv preprint arXiv:2602.02222, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.278537Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:f723811db18fd7e4662df848e3d7fc2781a9d36d7c6aa002744bb87936734414","observation_id":"7f2fd2d0-9f73-446e-b340-722c63f6774d","resolution":{"observed_at":"2026-08-02T01:25:16.278537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.365494Z","title":"Is space-time attention all you need for video understanding? InIcml, volume 2, page 4, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.365494Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:0808094d81637d8c4bc49eb12fb3033535428c9805dc7bc78f85f12165da8647","observation_id":"99c4b83f-0761-4583-97b6-d72d75668db1","resolution":{"observed_at":"2026-08-02T01:25:16.365494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.470276Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training.Advances in neural information processing systems, 35:10078–10093, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.470276Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:7d89ee6caa6e00e3dc737e4f335c5b94dd45d335975bae64c3880562484b55f7","observation_id":"0055b29e-2f2a-426a-8515-887c2d7c89aa","resolution":{"observed_at":"2026-08-02T01:25:16.470276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-07T04:39:25.258902Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-08-02T01:25:16.561201Z","title":"Uni- formerv2: Spatiotemporal learning by arming image vits with video uniformer.arXiv preprint arXiv:2211.09552, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.561201Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:e1c02e153b62714058479fa279636779a4613d569f513720c561461f99ea8b22","observation_id":"09b3d675-5426-4733-88da-c9b72119243f","resolution":{"observed_at":"2026-08-02T01:25:16.561201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.658927Z","title":"Slowfast networks for video recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.658927Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:7fba34ab6e3771cee936c2c157d10e760b8755def18205c2c68224467e7816f9","observation_id":"041493e6-e6ec-4441-86e5-1a7f4597f67e","resolution":{"observed_at":"2026-08-02T01:25:16.658927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.792581Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.792581Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:b2cfb4316023176d9e7e41cbe6e08e1a22cc15fc33c95361c20581c8d691a616","observation_id":"b21f3564-6701-411c-83eb-cfae861949f4","resolution":{"observed_at":"2026-08-02T01:25:16.792581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:16.898164Z","title":"Expanding language-image pretrained models for general video recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.898164Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:9e5f3f4c293afdea950c67bd89d43cc99f05a7b3658fb1d0e69929198bcf6b53","observation_id":"6a607de3-78b1-403a-a517-ae4e3e412541","resolution":{"observed_at":"2026-08-02T01:25:16.898164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-08T17:46:50.107463Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-02T01:25:16.991871Z","title":"The kinetics human action video dataset.arXiv preprint arXiv:1705.06950, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:16.991871Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:b1b67f78770a3e5adb9166f80bd4e0f4f2809aa5e392f5225f9977abdf6a312b","observation_id":"373ff367-c2a7-4246-9402-0f12d6ac6365","resolution":{"observed_at":"2026-08-02T01:25:16.991871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:17.064583Z","title":"Com- bining efficientnet and vision transformers for video deepfake detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.064583Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:aea8dfd86f5f1e5c038d4fa4f18373d2619121b3e10ddf5a022b4fd9b4124d29","observation_id":"335c2d24-1741-4f7c-bd06-ccc7091b27e8","resolution":{"observed_at":"2026-08-02T01:25:17.064583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01353","last_updated":"2021-04-03T09:13:05Z","snapshot_observed_at":"2026-08-04T06:30:11.616080Z","submitted_at":"2021-04-03T09:13:05Z","title":"Deepfake Detection Scheme Based on Vision Transformer and Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01353","snapshot_observed_at":"2026-08-02T01:25:17.202580Z","title":"Deepfake detection scheme based on vision transformer and distillation.arXiv preprint arXiv:2104.01353, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.202580Z"},"links":{"cited_paper":"/paper/2104.01353","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:d324d38cb0d4e333723b011fb96b4a874a9cfa3e737a8776ec150521252232d2","observation_id":"5431405e-c989-4915-ac29-1448dfb67fdf","resolution":{"observed_at":"2026-08-02T01:25:17.202580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11126","last_updated":"2021-03-11T13:45:17Z","snapshot_observed_at":"2026-08-07T03:50:56.678417Z","submitted_at":"2021-02-22T15:56:05Z","title":"Deepfake Video Detection Using Convolutional Vision Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.11126","snapshot_observed_at":"2026-08-02T01:25:17.344843Z","title":"Deepfake video detection using convolutional vision transformer.arXiv preprint arXiv:2102.11126, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.344843Z"},"links":{"cited_paper":"/paper/2102.11126","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:1bf83aa4816498b54029efe997d4be7b5633bd258e7e7a094f7acf7020e45c58","observation_id":"301ee4ad-b05c-4089-9967-3ed109403058","resolution":{"observed_at":"2026-08-02T01:25:17.344843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:17.454019Z","title":"Deep convolutional pooling trans- former for deepfake detection.ACM transactions on multimedia computing, communications and applications, 19(6):1–20, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.454019Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:118d8b40abe93461beaf38e62f8cbdeaf5dd95b1f5d4a161cfdd8af57cdd4d22","observation_id":"aeb920ba-5d9d-48f5-831a-041d629028e4","resolution":{"observed_at":"2026-08-02T01:25:17.454019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:17.592001Z","title":"Ai-generated video detection via perceptual straightening.arXiv preprint arXiv:2507.00583, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.592001Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:14221e31a89cd07b9bfd91a070f837c167cba6fa590ee9d230a5334a2e830168","observation_id":"90c32ed6-d98a-4170-b143-59041ba2a0c5","resolution":{"observed_at":"2026-08-02T01:25:17.592001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:25:17.711764Z","title":"Genvidbench: A challenging benchmark for detecting ai-generated video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.711764Z"},"links":{"citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:ddef8b1ed023db2b3d7a4ab9527ce01fdda226729f3ebe37a4e19fa54b10e26a","observation_id":"410d13bf-647f-44a7-bdf0-d8adacfd63d6","resolution":{"observed_at":"2026-08-02T01:25:17.711764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T01:25:17.797045Z","title":"Qwen3-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:25:17.797045Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15321"},"observation_digest":"sha256:45397b974a3a107a2da951c82bc466e9ec75712ad53a1c407552005cea5d15af","observation_id":"e7baab03-7d6c-454b-ad02-d02bfe7f14d0","resolution":{"observed_at":"2026-08-02T01:25:17.797045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15321","last_updated":"2026-07-16T07:57:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T16:50:33.461941Z","submitted_at":"2026-07-16T07:57:31Z","title":"Rethinking the Readout: Unlocking Video Backbones for AI-Generated Video Detection"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2607.15321."}