{"as_of":"2026-08-10T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea0d38090acae22deb3ad3c0e52d7daf351bd30fbb7125ad5f0d2313b2bb59bf","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:09:53.574402Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25543/citation-record","integrity":"/paper/2607.25543/integrity","json":"/paper/2607.25543/citation-record.json","paper":"/paper/2607.25543"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:48.857900Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations.Advances in neural information processing sys- tems, 33:12449–12460,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:48.857900Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:a931100b7fd21b02a32ad79a4da8d84e26361fccdbb61785afa5d517f56a8160","observation_id":"d21954bb-20e7-42de-827a-6a987fd1a145","resolution":{"observed_at":"2026-08-01T02:09:48.857900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.437054Z","title":"Insid3: Training-free in-context segmentation with dinov3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.437054Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:2f7a83822839d9acec7b5fb000251f8a9d5c610f9e29496930cbff8fb9ec9877","observation_id":"a06f07ba-eca7-4568-ac37-7e6dc86b4530","resolution":{"observed_at":"2026-08-01T02:09:49.437054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.548938Z","title":"Pia: Deepfake detection using phoneme-temporal and identity-dynamic analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.548938Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:4feb7bf29848de5f4815bd5ec26ac2227e767ef1b59e0c4a70c837cc54fc5dbb","observation_id":"049baba8-b829-41e1-841a-4a80ac54c9d7","resolution":{"observed_at":"2026-08-01T02:09:49.548938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-01T02:09:49.769563Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.769563Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:49f39bb7d06e12fe8fe661325e2585b045de991e61ccb189c33479ff500567b4","observation_id":"8b7d05fd-4258-4c70-baf6-324d8a72bd6d","resolution":{"observed_at":"2026-08-01T02:09:49.769563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.844096Z","title":"Self-supervised video forensics by audio-visual anomaly detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.844096Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:6b086b07e70f14bb340a1dfb8822febf440dbe30eeab4c3c494f601440c72f48","observation_id":"a5aad4fe-64ae-45b7-8c23-0d73a1c1b456","resolution":{"observed_at":"2026-08-01T02:09:49.844096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.953350Z","title":"Allm4add: Unlocking the capabilities of audio large language models for audio deepfake detec- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.953350Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:3a34b4d2bf5a18a805a0b235bc8d9d2dd14b08d616832b30a832812ad037be8d","observation_id":"cd1e397c-e1f0-4e38-a60d-49f8c67ee296","resolution":{"observed_at":"2026-08-01T02:09:49.953350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:50.130319Z","title":"Lips don’t lie: A generalisable and robust approach to face forgery detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.130319Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:a05b76bb91a9d1647f22dc3980e8005c60974806a3ecc56efec6fbdfc7661ec0","observation_id":"94a7e381-8a5f-48c0-ac8e-ce75e9acacba","resolution":{"observed_at":"2026-08-01T02:09:50.130319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.00336","snapshot_observed_at":"2026-08-01T02:09:50.577740Z","title":"Mvad: A comprehensive multimodal video-audio dataset for aigc detection.arXiv preprint arXiv:2512.00336,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.577740Z"},"links":{"cited_paper":"/paper/2512.00336","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:8983a9daaa5e962026e82cadbe43214f48db91ba9d490bab78a061876a102c28","observation_id":"8a8c9257-e712-4914-bca4-bfb95e7a82f4","resolution":{"observed_at":"2026-08-01T02:09:50.577740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:50.683602Z","title":"Aasist: Audio anti-spoofing us- ing integrated spectro-temporal graph attention networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.683602Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:bbb09dd0a90669abafebda68060274c8bb1eb4f56cb5ec38b899b597927872f4","observation_id":"6d2fae84-7a0c-4999-a950-74904727e3b8","resolution":{"observed_at":"2026-08-01T02:09:50.683602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-01T02:09:50.854828Z","title":"Fakeavceleb: A novel audio- video multimodal deepfake dataset.arXiv preprint arXiv:2108.05080,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.854828Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:4c29e21b5f85fd22bd5bba6250a32afcf07f49e4e5ea80e484ada36976ed6240","observation_id":"77b45b59-cacd-4329-abf8-15d9fba44e37","resolution":{"observed_at":"2026-08-01T02:09:50.854828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:50.989395Z","title":"iwax: interpretable wav2vec-aasist-xgboost framework for voice spoofing detection.Scientific reports, 15(1):40491,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.989395Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:6217439fbcdd70db776fee95831f33d1bfc85b912ed0041bcd0e77246df93320","observation_id":"cd5d01d3-8cc3-4fce-aa42-dd13d1107c9c","resolution":{"observed_at":"2026-08-01T02:09:50.989395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.121808Z","title":"Speechforensics: Audio- visual speech representation learning for face forgery de- tection.Advances in Neural Information Processing Sys- tems, 37:86124–86144,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.121808Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:84a926ae729a09a3d55cb2dbb9fd5be3d6c49b610619330d68684f08ce15b9d9","observation_id":"79ec3962-6cfa-4c88-9f05-6a13651c223a","resolution":{"observed_at":"2026-08-01T02:09:51.121808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.203686Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.203686Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:e49cdbaefdcd55d5ab8cb326bc64f7862806fd49e519c66d89ab8869a64aef11","observation_id":"5ec1c3a9-3b37-4aa2-9327-eef39679df73","resolution":{"observed_at":"2026-08-01T02:09:51.203686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.416673Z","title":"Multi-modal deepfake detection via multi-task audio-visual prompt learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.416673Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:53c1a01b09a8396d16f0d2d28da99a294ecea2282057e5d47ae33f26b6ae5bb3","observation_id":"12b9a30b-3de2-48b2-b3eb-8b887bd84c0e","resolution":{"observed_at":"2026-08-01T02:09:51.416673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1109.2378","last_updated":"2011-09-12T05:49:11Z","snapshot_observed_at":"2026-08-03T18:17:29.793532Z","submitted_at":"2011-09-12T05:49:11Z","title":"Modern hierarchical, agglomerative clustering algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1109.2378","snapshot_observed_at":"2026-08-01T02:09:51.522133Z","title":"Modern hierarchical, agglomerative clustering algorithms.arXiv preprint arXiv:1109.2378,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.522133Z"},"links":{"cited_paper":"/paper/1109.2378","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:c09bd3a0d0b4ce2929527e44d6976c4eeea24a7f9b9516094988efaef77b8a14","observation_id":"8b043dcf-f546-4197-ab4b-cbf812a5d98b","resolution":{"observed_at":"2026-08-01T02:09:51.522133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.699948Z","title":"Avff: Audio- visual feature fusion for video deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.699948Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:56e1eebc2f8a7090a1f09508fbcdede8a93d1217fe08a2f23eac933e5ba427f8","observation_id":"dcaa609f-4783-4efb-92b1-bbabbf9732d0","resolution":{"observed_at":"2026-08-01T02:09:51.699948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.765083Z","title":"Leave no stone unturned: Un- covering holistic audio-visual intrinsic coherence for deep- fake detection","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.765083Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:bb468f7c46848e5c2c59887cb78ad3c44df12ed94bb22f39bd885c5439679867","observation_id":"49dfbbf7-9a1f-4d9c-96a4-708a0283d036","resolution":{"observed_at":"2026-08-01T02:09:51.765083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.908551Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.908551Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:0e0f587343d6007c698986633ea03f37f206a45ddb231f32d48761b8ed64535b","observation_id":"8eb3554f-777e-4dd6-bf24-3232ecca03ec","resolution":{"observed_at":"2026-08-01T02:09:51.908551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.006521Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.006521Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:e5c345c0abe937f3fc498c9df990a39a4259c81b10188fe768522cda25318d33","observation_id":"e9b007bf-10a1-4f90-bd2f-d3a59e443f54","resolution":{"observed_at":"2026-08-01T02:09:52.006521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-07T00:15:34.035413Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-01T02:09:52.116351Z","title":"Learning audio-visual speech representation by masked multimodal cluster pre- diction.arXiv preprint arXiv:2201.02184,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.116351Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:140b5fa5882164e41bb671e34ec86482d4d270aa02877fc4095994becd77b828","observation_id":"47d8d709-c8a7-4fa2-9f76-942b31511c2b","resolution":{"observed_at":"2026-08-01T02:09:52.116351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.275924Z","title":"Detecting deepfakes with self-blended im- ages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.275924Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:2b4e58853364b6c1ece927683e45591eb8db183130b3c7050182a109ef336c15","observation_id":"b99be693-ace2-4a39-b407-5198e4cb856d","resolution":{"observed_at":"2026-08-01T02:09:52.275924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-07-06T22:12:35.584339Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-01T02:09:52.375993Z","title":"Dinov3.arXiv preprint arXiv:2508.10104,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.375993Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:8ede96d4afe48bf1050517a0f85a3cfff159f91d1daf185871343683d3ff83f7","observation_id":"90f231b9-1b27-4967-8151-4e35ffafc071","resolution":{"observed_at":"2026-08-01T02:09:52.375993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.526745Z","title":"Circumventing shortcuts in audio-visual deepfake detection datasets with unsupervised learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.526745Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:4fe2228661760d44655bd9d0acbcbaba489a4e09bb2a188ad39e77a0eee9c78f","observation_id":"9d4a57dd-204b-4bbf-bb71-827f902c4649","resolution":{"observed_at":"2026-08-01T02:09:52.526745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12233","last_updated":"2022-02-28T11:50:57Z","snapshot_observed_at":"2026-07-06T12:41:22.635071Z","submitted_at":"2022-02-24T17:55:00Z","title":"Automatic speaker verification spoofing and deepfake detection using wav2vec 2.0 and data augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12233","snapshot_observed_at":"2026-08-01T02:09:52.581372Z","title":"Automatic speaker verification spoofing and deep- fake detection using wav2vec 2.0 and data augmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.581372Z"},"links":{"cited_paper":"/paper/2202.12233","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:db088f47f936e1b790ecbdddfd74e1316a050b369a84f4a4c18ad3185724245f","observation_id":"d241e4f7-e4ba-4426-8941-af8980821d91","resolution":{"observed_at":"2026-08-01T02:09:52.581372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.648659Z","title":"Attention is all you need.Advances in neural information processing systems, 30,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.648659Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:e40fc2d3c2a4544e77ba11974b0e4ec044f7ad64febb0a672fa2136292d10698","observation_id":"35a034be-ed87-4190-a668-bfa5cb08f4ba","resolution":{"observed_at":"2026-08-01T02:09:52.648659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.795863Z","title":"Pushing the frontier of audiovisual per- ception with large-scale multimodal correspondence learn- ing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.795863Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:eeb4e7c5462a52bdeca16bf975298dc2a01f0dba7facf052534911334e0b7273","observation_id":"1d48218b-c042-40ab-8b23-3844273fa18e","resolution":{"observed_at":"2026-08-01T02:09:52.795863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:52.951339Z","title":"Facex-zoo: A pytorch toolbox for face recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:52.951339Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:ce95a42268990ce4bd0efa24c883ade4be028956d50603dc55e1b485161c1659","observation_id":"0059a33d-31d3-4de9-a5f3-d9c369ceac83","resolution":{"observed_at":"2026-08-01T02:09:52.951339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02335","last_updated":"2024-01-04T16:19:52Z","snapshot_observed_at":"2026-08-08T20:11:12.803705Z","submitted_at":"2024-01-04T16:19:52Z","title":"Linguistic Profiling of Deepfakes: An Open Database for Next-Generation Deepfake Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02335","snapshot_observed_at":"2026-08-01T02:09:53.053555Z","title":"Linguistic profiling of deep- fakes: An open database for next-generation deepfake de- tection.arXiv preprint arXiv:2401.02335,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.053555Z"},"links":{"cited_paper":"/paper/2401.02335","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:eeb62e29f6d92a0bc0658d18f0e8808353f55bed9fe41419c480e73ab1b25961","observation_id":"1678a59c-bdc2-4c73-833b-c16b8db5be8f","resolution":{"observed_at":"2026-08-01T02:09:53.053555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.084039Z","title":"Asvspoof: The automatic speaker verification spoofing and countermeasures challenge","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.084039Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:d96c79c1258ab2d4fd8986d88b66e9b8b9af79fcb5838492eff56d26639393ea","observation_id":"d4829b0d-2f85-4521-b610-feb32a2daf1c","resolution":{"observed_at":"2026-08-01T02:09:53.084039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.150736Z","title":"Detect all-type deepfake audio: Wavelet prompt tuning for enhanced auditory perception","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.150736Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:0aab04cc4d4a105a53ccc3caedf088d55c84039376554aec194e99c1724f567c","observation_id":"73fda227-3624-4b12-9182-d6473ebc2e18","resolution":{"observed_at":"2026-08-01T02:09:53.150736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15633","last_updated":"2025-05-20T12:06:56Z","snapshot_observed_at":"2026-08-06T14:53:33.853203Z","submitted_at":"2024-11-23T19:10:32Z","title":"Orthogonal Subspace Decomposition for Generalizable AI-Generated Image Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15633","snapshot_observed_at":"2026-08-01T02:09:53.253285Z","title":"Orthogo- nal subspace decomposition for generalizable ai-generated image detection.arXiv preprint arXiv:2411.15633,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.253285Z"},"links":{"cited_paper":"/paper/2411.15633","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:1a1bae80002885927254e27596b7891a1739115fc4f07840273140d93bf7ac74","observation_id":"82701a77-5448-4500-a261-0864baf22d3b","resolution":{"observed_at":"2026-08-01T02:09:53.253285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.396219Z","title":"Avoid-df: Audio-visual joint learning for detecting deepfake.IEEE Transactions on Information Forensics and Security, 18:2015–2029,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.396219Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:f64a09d5e0c6556420c52ae616fe41d940b627f72111a183bb3174fdd63b4b75","observation_id":"909e0230-2c56-4710-abae-726811c4d25e","resolution":{"observed_at":"2026-08-01T02:09:53.396219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.402575Z","title":"Fine- grained multimodal deepfake classification via heteroge- neous graphs.International Journal of Computer Vision, 132(11):5255–5269,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.402575Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:7f42c8c22687eff74420f4a4a6ef23b4d2a1f10c224494f2fa4a76904afb4cb4","observation_id":"13bb1db2-a55a-48b0-bd59-5d2723ed0979","resolution":{"observed_at":"2026-08-01T02:09:53.402575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.501283Z","title":"Multi-attentional deepfake detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.501283Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:5702c70a0fc0f9a037a610aaf9d464c16cbb353bbfa91657370597341a200558","observation_id":"c40a6535-bef4-4ab0-b255-d8c2bace6391","resolution":{"observed_at":"2026-08-01T02:09:53.501283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:53.574402Z","title":"Cross- modality and within-modality regularization for audio- visual deepfake detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:53.574402Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:53f682407ca8d5682cf76023dc6ddec1fceb7ad6107100e0a1f3836250f63a46","observation_id":"7b0aabef-c93c-4383-b8d4-2b5075abc879","resolution":{"observed_at":"2026-08-01T02:09:53.574402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.679339Z","title":"Towards generalizable deepfake detection via forgery-aware audio-visual adapta- tion: A variational bayesian approach.IEEE Transactions on Information Forensics and Security,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.679339Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:138d6ded6f71383b82cb20c56eaeb06e1f54f6bb45ec7ef4fae49803bc7ee77b","observation_id":"de0a9356-e684-49c7-885b-24cbfc71c09f","resolution":{"observed_at":"2026-08-01T02:09:51.679339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:51.311391Z","title":"Mcl: multimodal contrastive learning for deep- fake detection.IEEE Transactions on Circuits and Systems for Video Technology, 34(4):2803–2813,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:51.311391Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:d1c8c5e83deb5ccaa54b3a6bad6b5ab1bb65deb01e779491b267f4071862a936","observation_id":"62a3ed47-6122-4837-9b96-e73c014137a8","resolution":{"observed_at":"2026-08-01T02:09:51.311391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:50.426680Z","title":"Lora: Low-rank adaptation of large language models.Iclr, 1(2):3,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.426680Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:e4e39e31cb32897553f15436e611651f88417c804468d6b2217cc9bbb73d6359","observation_id":"bde62e39-3ad9-4c80-9615-d6bb99a3a20d","resolution":{"observed_at":"2026-08-01T02:09:50.426680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:48.925734Z","title":"Self-supervised learning of adversarial example: Towards good generalizations for deepfake detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:48.925734Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:ff76f2818bfe326fbd83f264403e0848796f97d86f83dfd83fe8e434d79e66ce","observation_id":"22760013-2034-4573-b22f-ec5c520ecdf1","resolution":{"observed_at":"2026-08-01T02:09:48.925734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:50.234179Z","title":"Squeeze- and-excitation networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.234179Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:77ff20326b83028d737a314fa8f6e639eaebe3018443d0879eb67c5a2fbe18fb","observation_id":"35401875-1d19-4048-a062-ec810cd8f30b","resolution":{"observed_at":"2026-08-01T02:09:50.234179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06086","last_updated":"2024-06-18T10:20:34Z","snapshot_observed_at":"2026-07-06T18:27:58.433967Z","submitted_at":"2024-06-10T08:13:42Z","title":"RawBMamba: End-to-End Bidirectional State Space Model for Audio Deepfake Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06086","snapshot_observed_at":"2026-08-01T02:09:49.095176Z","title":"Rawbmamba: End-to-end bidirectional state space model for audio deep- fake detection.arXiv preprint arXiv:2406.06086,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.095176Z"},"links":{"cited_paper":"/paper/2406.06086","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:582acc422381bc43f402df9dd3189b8f5ac8913c9a10d866aa3138ea16f590d5","observation_id":"f386e5d9-312b-43f8-b8ab-c4a9517e5825","resolution":{"observed_at":"2026-08-01T02:09:49.095176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13979","last_updated":"2020-12-15T23:19:19Z","snapshot_observed_at":"2026-08-10T13:01:12.584770Z","submitted_at":"2020-06-24T18:25:05Z","title":"Unsupervised Cross-lingual Representation Learning for Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13979","snapshot_observed_at":"2026-08-01T02:09:49.283745Z","title":"Unsupervised cross-lingual representation learning for speech recognition.arXiv preprint arXiv:2006.13979,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.283745Z"},"links":{"cited_paper":"/paper/2006.13979","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:63aa867bf9a361b992bd97a950ec0863942e9da6535c20ec24b2af99bf8d6027","observation_id":"c0e44047-2705-449b-9c3c-749894f32257","resolution":{"observed_at":"2026-08-01T02:09:49.283745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.152898Z","title":"De- mamba: Ai-generated video detection on million-scale genvideo benchmark.Science China Information Sci- ences, 69(6):162103,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.152898Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:761a9f5fc3d2748c7bfc19d1e748ed330d363e2dc18714c7718e037f76ab0139","observation_id":"7df487f4-4241-42dd-ada6-fb8809ecb1ed","resolution":{"observed_at":"2026-08-01T02:09:49.152898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.660790Z","title":"Simlbr: Learning to detect fake images by learning to detect real images","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.660790Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:2b3098de07ce92405a079db0d48be5d938539fa3f379fc97dc9b82295ce7acfb","observation_id":"292e1ccd-bcf1-48ad-b65f-7d5123ea1cf5","resolution":{"observed_at":"2026-08-01T02:09:49.660790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:09:49.182302Z","title":"V oice-face homogeneity tells deepfake.ACM Transactions on Mul- timedia Computing, Communications and Applications, 20(3):1–22,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:49.182302Z"},"links":{"citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:0d765bbe0ab9021120e34d4fbfe3b470f32c5cb27f84c57a2cd8800a0510ad97","observation_id":"a000bfa2-fe23-4821-ab44-2e954758baab","resolution":{"observed_at":"2026-08-01T02:09:49.182302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.25543."}