{"as_of":"2026-08-10T18:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:51194e4203a613fa0c49f605b1f92e01e047b36a4e1175d658eb355b411781a8","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T03:48:26.807495Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:09:50.577740Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.00336","snapshot_observed_at":"2026-08-01T02:09:50.577740Z","title":"Mvad: A comprehensive multimodal video-audio dataset for aigc detection.arXiv preprint arXiv:2512.00336,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25543","last_updated":"2026-07-28T10:23:36Z","snapshot_observed_at":"2026-08-07T04:05:31.243560Z","submitted_at":"2026-07-28T10:23:36Z","title":"Less is More: Modality-Decoupling for General AIGC Audio-Video Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:09:50.577740Z"},"links":{"cited_paper":"/paper/2512.00336","citing_paper":"/paper/2607.25543"},"observation_digest":"sha256:8983a9daaa5e962026e82cadbe43214f48db91ba9d490bab78a061876a102c28","observation_id":"8a8c9257-e712-4914-bca4-bfb95e7a82f4","resolution":{"observed_at":"2026-08-01T02:09:50.577740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.00336/citation-record","integrity":"/paper/2512.00336/integrity","json":"/paper/2512.00336/citation-record.json","paper":"/paper/2512.00336"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T08:36:07.226215Z","title":"write newline","venue":null,"work_id":"8481976a-f196-4822-833d-e487ae5a1e81","year":null},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:153b1a09be01152f54a82a0cc7da7fafb06d388a4b8d2aa4701d0be8530dcd7a","observation_id":"385ea3f2-394b-4b69-942f-8a78c5f7a5a4","resolution":{"observed_at":"2026-05-17T03:48:58.682602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":"2501.03575","doi":"10.48550/arxiv.2501.03575","metadata_source":"pith","pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cosmos World Foundation Model Platform for Physical AI","venue":"cs.CV","work_id":"a2dba24c-318d-476a-8b21-4289c265810c","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e9faec738a4c82336fcc07c880df3ae1bdfe0d52936cf19de04661ad0a4fd84c","observation_id":"be46b26c-0823-4a42-b745-796776d3d43e","resolution":{"observed_at":"2026-05-17T03:48:58.485045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:29.560535+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pixverse: Ai video generation platform","venue":null,"work_id":"6c5f335f-a482-4907-bb55-0ba30bb37fd0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:0e9ac569382f863f12b588a960eab5e19e4d160cf88ddde3eb3ddd408aeda888","observation_id":"bfb3ff66-0d22-46e4-99bc-01b76015ee21","resolution":{"observed_at":"2026-05-17T03:48:58.748751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan (tongyi wanxiang): Ai video generation platform","venue":null,"work_id":"a30caec4-c8ed-4404-8c5d-463d593bd473","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:4cbe6adb579b67fa05f9de55f4296b69b7a39aef5c3516a2dad79352b77b03a1","observation_id":"06801ed0-8e3d-42a7-a8cc-015c18139320","resolution":{"observed_at":"2026-05-17T03:48:58.689467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ai-generated video detection via spatial-temporal anomaly learning","venue":null,"work_id":"c3dec086-d259-4961-8be1-dcba19f14070","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:7ba2db30083883e8ab45988076d3a119f74efdc874159fb780358efd04f4a57a","observation_id":"ba1ad8be-6252-440e-b739-2ae62638602e","resolution":{"observed_at":"2026-05-17T03:48:58.686307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Christodorescu, M., Datta, A., Feizi, S., et al","venue":null,"work_id":"fbb8a187-f8d7-44fd-8f10-a34ba17ec1c1","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:87aa197722e7a64e2fc60d0c32326d7f85fe6d976c95566bc673cb4788510596","observation_id":"fb233442-266a-4ef8-9531-6a1c30fc9d98","resolution":{"observed_at":"2026-05-17T03:48:58.760771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:1b5e702be50ba272f898de8bf0fd80a3529a0710fde13aac3590f5b99838b9ad","observation_id":"f9debaa9-ecb0-43ec-a26f-ce1b534b8a3a","resolution":{"observed_at":"2026-05-17T03:48:58.498245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Dolan, W","venue":null,"work_id":"acfaf0ca-ab1f-45c5-a8db-1f18b1b0e13e","year":2011},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:641da3a4b53c78d20ad2f1976937c99d6aad0179b6e244e4ba2b52ee7be9202a","observation_id":"9e456cce-2586-4711-beb9-c400eef1481a","resolution":{"observed_at":"2026-05-17T03:48:58.743124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffute: Universal text editing diffusion model","venue":null,"work_id":"8e01283e-794d-4952-9736-b7f7a16be6d8","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:a17c0d6a046b0a588e4223b2ad33f72733886c5ecfe907c8b21220eb9a317678","observation_id":"5c2d038c-5b25-4881-9559-0cdb87202e9c","resolution":{"observed_at":"2026-05-17T03:48:58.718885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19707","last_updated":"2024-08-22T09:48:49Z","snapshot_observed_at":"2026-08-09T19:18:25.791123Z","submitted_at":"2024-05-30T05:36:12Z","title":"DeMamba: AI-Generated Video Detection on Million-Scale GenVideo Benchmark","version":3},"cited_work":{"arxiv_id":"2405.19707","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.19707","snapshot_observed_at":"2026-07-02T13:56:59.231785Z","title":"Demamba: Ai-generated video detection on million-scale genvideo benchmark","venue":null,"work_id":"7ac1e8a8-2f81-4be9-b84c-03ad1078adcc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2405.19707","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:83873b5b95be086b85246acfd6579394e1358881ab9d29ceef989eca4c5c51f8","observation_id":"5f9987b1-f6a8-4b79-884d-a082faac9e62","resolution":{"observed_at":"2026-05-17T03:48:58.490202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":"2786aeb7-e33d-4229-b40a-415b1c5daade","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:dcad008c18ffa2ea0fcaa45697d7536bac7c95372a0cf6ab4b616b2e3bffe4d6","observation_id":"a283af88-5db6-41a9-b208-470110ee1944","resolution":{"observed_at":"2026-05-17T03:48:58.669045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:029a3ae1c0393f1aeb59094f21536ba8fe4c9f28b022c0f46631cad457514b36","observation_id":"b2177093-0791-4c79-9f92-221d3a59a587","resolution":{"observed_at":"2026-05-17T03:48:58.476215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e871662aa31988e7e367d80ed90b8d808e2ee9e5d5debb8743b366e2959e616a","observation_id":"aff5c502-e45a-46f6-8ca0-34a01eb77b0b","resolution":{"observed_at":"2026-05-17T03:48:58.439681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10975","last_updated":"2025-06-12T17:59:33Z","snapshot_observed_at":"2026-08-10T15:25:53.178624Z","submitted_at":"2025-06-12T17:59:33Z","title":"GenWorld: Towards Detecting AI-generated Real-world Simulation Videos","version":1},"cited_work":{"arxiv_id":"2506.10975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10975","snapshot_observed_at":"2026-07-01T22:56:20.995621Z","title":"Genworld: Towards detect- ing ai-generated real-world simulation videos","venue":null,"work_id":"c1031e17-6d82-43c8-abfa-e14f425d6ec4","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2506.10975","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8667e33c0e4af999ac3182ee911f478ac1a077335824b4ee94ab4a62b3f835b5","observation_id":"6b415433-1011-4cb0-91c8-4ba9b555151f","resolution":{"observed_at":"2026-05-17T03:48:58.508275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., Ishii, M., Hayakawa, A., Shibuya, T., Schwing, A., and Mitsufuji, Y","venue":null,"work_id":"ddbb7d3c-ac8e-408e-b451-09a57bd08686","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:fe3e320ad9c092ca157c98f8b041068a9961dd65f3c43270787bc657ee0b3723","observation_id":"f94fbd65-2ad7-41ee-9536-01bb94e8e7e5","resolution":{"observed_at":"2026-05-17T03:48:58.729168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepseek ai chat platform","venue":null,"work_id":"df488d37-4b1a-48f0-9cb3-4d0e1a4330f0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:545fa8fdb08886c72e14c4326f4b3e54bd90df703a953e79f1eba3426dc461ee","observation_id":"9d832905-4a76-41b1-86c7-d6383882e2dd","resolution":{"observed_at":"2026-05-17T03:48:58.698974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07397","last_updated":"2020-10-28T03:48:28Z","snapshot_observed_at":"2026-07-06T09:28:36.954658Z","submitted_at":"2020-06-12T18:15:55Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","version":4},"cited_work":{"arxiv_id":"2006.07397","doi":"10.48550/arxiv.2006.07397","metadata_source":"pith","pith_arxiv_id":"2006.07397","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The DeepFake Detection Challenge (DFDC) Dataset","venue":"cs.CV","work_id":"c15e77e5-8189-45a5-98ca-f6d6286fb6e5","year":2020},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2006.07397","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:6f89b4ec984e13ab14552b262be159f17ea8627b2c1cfae1c87df4cf463d252d","observation_id":"cbfb7b39-9a4d-4015-a19b-eec7d01089aa","resolution":{"observed_at":"2026-05-17T03:48:58.449861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Privacy and security concerns in generative AI : A comprehensive survey","venue":null,"work_id":"998a1ae3-fc7b-4966-baaa-af7e3e3787e0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:f49fb23eb5c00fa3e14c3191d83e66458ba09bd7af761fb4bb82f7b75f81c30b","observation_id":"d17fb73d-1e4e-4406-85f2-089e4660f65f","resolution":{"observed_at":"2026-05-17T03:48:58.710603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Haiper AI : AI video generation platform","venue":null,"work_id":"7e79a854-4172-4a62-af1f-259bf2b60245","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:8f3a8b0065b65112f86dc47a2835ce5c1d4a0592074bb2453a965b9a6eec48b6","observation_id":"274e194d-73f5-4ddb-8c66-12fdeaf162c7","resolution":{"observed_at":"2026-05-17T03:48:58.757722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"0df234b0-7229-46c1-9e5e-0c66a4866810","year":2020},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:e326dc5676d1ac67132974f03615255ece65582bbf0b5ec9f21f7aa8a7f61246","observation_id":"fadd186e-dc12-4b94-aa28-d98c3e458f1a","resolution":{"observed_at":"2026-05-17T03:48:58.763921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VBench : Comprehensive benchmark suite for video generative models","venue":null,"work_id":"e29c1290-1a74-4efa-8d36-0503cefad58e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:67fbf5ec54d86bd3d983d6ee2585dec62ca41b3d25c4825be927a660a5d0fbdc","observation_id":"c2ebd8ed-355e-449c-bf08-2d4498977f32","resolution":{"observed_at":"2026-05-17T03:48:58.776552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcaai.2024/46","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech-forensics: Towards comprehensive synthetic speech dataset establishment and analysis","venue":null,"work_id":"46648769-78f9-4c25-bb45-9aea8e32df2f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:c7919cfb75d2fbbed8589a0e156adb8c44912faa54b1ae2aadc2dcb63fb6d6f8","observation_id":"a4bbcb05-04ed-4b7a-bde3-d240acb30e22","resolution":{"observed_at":"2026-05-17T03:48:58.222809Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jiying ai: Video generation platform","venue":null,"work_id":"6b9a2f03-2ee4-4684-8897-a28b757c3b20","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:d6da4b29e1d417a5929546d134089af6a5daf109499b479c70f0882e531a82aa","observation_id":"efb550e6-1126-44ec-857e-4afc930f274e","resolution":{"observed_at":"2026-05-17T03:48:58.773431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spoofceleb: Speech deepfake detection and SASV in the wild","venue":null,"work_id":"e6780a0d-e1b3-4c4d-8758-4a609cdfb227","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:2cb2c4a90e94309edebf176def61766aaf3995031c5a11dd23862fcd252fd30e","observation_id":"91bd9d9e-d018-4d1d-91b8-fa56f35463cb","resolution":{"observed_at":"2026-05-17T03:48:58.770380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05080","last_updated":"2022-03-01T10:38:07Z","snapshot_observed_at":"2026-08-06T06:30:26.873321Z","submitted_at":"2021-08-11T07:49:36Z","title":"FakeAVCeleb: A Novel Audio-Video Multimodal Deepfake Dataset","version":4},"cited_work":{"arxiv_id":"2108.05080","doi":"10.48550/arxiv.2108.05080","metadata_source":"pith","pith_arxiv_id":"2108.05080","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FakeA VCeleb: A novel audio-video multimodal deepfake dataset.arXiv preprint arXiv:2108.05080","venue":"cs.CV","work_id":"fe618fae-959b-4493-aef9-9ec5715f256d","year":2021},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2108.05080","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:3c9ad94eb39de95ae277b015711b29691a2c986853b3ca4c0c5e3af841a8fc8d","observation_id":"8a75ae79-6716-4ef4-8cad-b3bbd923a34c","resolution":{"observed_at":"2026-05-17T03:48:58.454672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling ai: Advanced video generation platform","venue":null,"work_id":"d4c237b7-0913-400c-b992-3477b5a84157","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:354512d5893e26cc8a93224d888a7b2f974f2ac98d2ba3a64f7a74e4838784ba","observation_id":"91a5a70c-1c20-4e7d-b3c2-d66fe2279a9c","resolution":{"observed_at":"2026-05-17T03:48:58.678930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kling ai: Advanced video generation platform","venue":null,"work_id":"ec2cda7c-f016-450b-b541-dff7749a2a46","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:267f18393a5a3caaeec76cf76ec8b42b960a3b8c6e14f91777a0be154131ad76","observation_id":"cb96bf76-a2d5-4192-948b-fa6beb9e0373","resolution":{"observed_at":"2026-05-17T03:48:58.740978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":"2312.14125","doi":"10.48550/arxiv.2312.14125","metadata_source":"pith","pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","venue":"cs.CV","work_id":"5cc3572d-7e2f-4431-ae42-d9282a42a800","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:3e5e840cda145b06c3d41186c72d174cbc6a24960c8bcb579a0b8cf8b5f8bbcd","observation_id":"0854a0a2-e6ca-4e51-b458-91b31e781a56","resolution":{"observed_at":"2026-05-17T03:48:58.444755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T03:24:43.956758+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Snapfusion: Text-to-image diffusion model on mobile devices within two seconds","venue":null,"work_id":"4cd872a1-d66c-42cc-8f2e-cf9f429a0d18","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:7e608580a1cbe2a07fb3d7bdf20d5ad2cae43ebd98440882a99989d4694fea7e","observation_id":"27f0263c-bbde-44e6-b260-79b9f16520ca","resolution":{"observed_at":"2026-05-17T03:48:58.704696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stiv: Scalable text and image conditioned video generation","venue":null,"work_id":"74e37dc2-43fa-496a-af38-36c607282769","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:97ad97030c982ace77cbeda3c8d0de8392148f38086437a297485abca0097b7b","observation_id":"c03309e9-ed0d-475e-8b3b-19fe2c112312","resolution":{"observed_at":"2026-05-17T03:48:58.701958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models","venue":null,"work_id":"616005c0-79d9-4847-a462-aaf483e4a7da","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:ded89f276a2b754f4106f902ac1f71431013e9344e4022e6e35107600f1e5abd","observation_id":"511b0684-6fdc-4b10-8744-d6a284b04226","resolution":{"observed_at":"2026-05-17T03:48:58.734095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.09949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Uve: Are mllms uni- fied evaluators for ai-generated videos?","venue":null,"work_id":"010783d3-c959-41ae-a7ca-4784395a9152","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:6ffa6abe9722d31a0c1071aa7e236a7d29cf8bde9fa3f1a52c8d29d2945c6bcb","observation_id":"06dfe0d5-1661-4759-8e92-498e5a3668d7","resolution":{"observed_at":"2026-05-17T03:48:58.434459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeCoF : Generated video detection via frame consistency: The first benchmark dataset","venue":null,"work_id":"a9e9e530-c288-4746-8905-d9eab2805329","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:40454333e10224bfd622308e7a6ef06a63ced1187d50a9ba593b4afef2176e91","observation_id":"373a8b8c-e438-4957-9e27-4af6ee801ae4","resolution":{"observed_at":"2026-05-17T03:48:58.731700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moonvalley: Ai video generation platform","venue":null,"work_id":"10e6bd25-1dfd-4d5c-9922-b19477bbe06f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:84db272152f3e89845b352c4ea21bf51e82c53674ff5e5fb6d6f475737945783","observation_id":"01b51975-af4e-457d-a69d-7620548f457b","resolution":{"observed_at":"2026-05-17T03:48:58.672210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02371","last_updated":"2025-02-13T10:13:24Z","snapshot_observed_at":"2026-08-07T10:03:56.902190Z","submitted_at":"2024-07-02T15:40:29Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","version":3},"cited_work":{"arxiv_id":"2407.02371","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.02371","snapshot_observed_at":"2026-07-05T16:41:18.954519Z","title":"OpenVid-1M: A Large-Scale High-Quality Dataset for Text-to-video Generation","venue":"cs.CV","work_id":"00dd95a8-d503-4a41-9603-785dcf4a0b8e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2407.02371","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:afeb9a5ccd5555f78082b8e5d3fa979fb36915a2ed211c7c3ea62b02f65e5122","observation_id":"de74674a-4403-4655-8f83-3db6bf4b7de4","resolution":{"observed_at":"2026-05-17T03:48:58.480719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.11340","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:33:50.981345Z","title":"Genvidbench: A challenging benchmark for detecting ai- generated video","venue":null,"work_id":"2c04927e-61cc-44ee-844a-c7c544b06bca","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:2297e7fd17b2c2c3de37348f6f48f32757c9572be2a2ac7af6d5cd5bde3f7f0f","observation_id":"9163091b-7f8a-46ac-9cb4-336cddaaa5c5","resolution":{"observed_at":"2026-05-17T03:48:58.518103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1352696b-dae1-4e4d-8d98-39c0089dd8dc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:f5500487e7a3f1f2895b24238c96f16ba0d4311b41bde8a2df88ec9e7f8a008f","observation_id":"49270c42-31b2-4728-82f8-aceaf78d57e4","resolution":{"observed_at":"2026-05-17T03:48:58.663956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora: Creating video from text","venue":null,"work_id":"c5f46323-1aa6-4fe1-8a45-c71ea90fb0d0","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:d09be82cc8a4b71305a5968ef2ccbce62c32d0bd4a1a9e3900a3c0aa37dc3faa","observation_id":"1ea498d5-e9f5-47c1-898f-f05538fb07cd","resolution":{"observed_at":"2026-05-17T03:48:58.745699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sora: Creating video from text","venue":null,"work_id":"817a7dbd-3c69-43a9-9d2f-52efaf887cbc","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:7b39e15e27366cec2d83c1b6fc6d21b3483389e01c5603cb5357bfc94e130b77","observation_id":"1c1cd15f-6ef9-420e-bcde-4cc2aa13ad2e","resolution":{"observed_at":"2026-05-17T03:48:58.767119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pika: Ai video generation platform","venue":null,"work_id":"07329cc0-da43-4282-8968-385988841bda","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:5766443f0216c2a81005448d42f70d1ea885747c56d1f007958237e19989f44f","observation_id":"4f57e052-4437-44d8-9169-69ba2369f3cf","resolution":{"observed_at":"2026-05-17T03:48:58.707582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Runwayml: Ai video generation platform","venue":null,"work_id":"22f187f6-0bc7-48a3-a90c-62ca8130756d","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:b788b21732144ed58a59ab7617c57a4604d2dbc97993b6eb03f307b1ceceb907","observation_id":"253e9e22-cc2c-42fa-b68f-6643fe72e3f9","resolution":{"observed_at":"2026-05-17T03:48:58.726841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16930","last_updated":"2025-08-23T07:30:18Z","snapshot_observed_at":"2026-08-09T16:55:24.799888Z","submitted_at":"2025-08-23T07:30:18Z","title":"HunyuanVideo-Foley: Multimodal Diffusion with Representation Alignment for High-Fidelity Foley Audio Generation","version":1},"cited_work":{"arxiv_id":"2508.16930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16930","snapshot_observed_at":"2026-07-02T04:56:39.439125Z","title":"Hunyuanvideo-foley: Multimodal diffusion with representation alignment for high-fidelity foley audio generation","venue":null,"work_id":"c52cc69a-842a-4c11-873a-e3d9aaaeb3de","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2508.16930","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:71c803191a6ae9ba7931188d45e492fc260b4e8e807ded7dd2f80090b4830b60","observation_id":"50efffe9-2666-45d3-a15b-0ec52b44af34","resolution":{"observed_at":"2026-05-17T03:48:58.471609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On learning multi-modal forgery representation for diffusion generated video detection","venue":null,"work_id":"d900bbc2-959b-4d4b-8983-508e6f68ba5a","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:5b464a0ca48230838aecf275a1745a8acbcf3a68783a08d42c523662694a866b","observation_id":"dea81e3e-a84a-4672-8059-f183746fb1a6","resolution":{"observed_at":"2026-05-17T03:48:58.724267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10522","last_updated":"2026-04-15T16:32:32Z","snapshot_observed_at":"2026-07-31T02:51:01.521373Z","submitted_at":"2025-03-13T16:30:59Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","version":4},"cited_work":{"arxiv_id":"2503.10522","doi":"10.48550/arxiv.2503.10522","metadata_source":"pith","pith_arxiv_id":"2503.10522","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"AudioX: A Unified Framework for Anything-to-Audio Generation","venue":"cs.MM","work_id":"ec79607c-bea2-4879-85ed-00db057adcc7","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2503.10522","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:766a5e720d42b81ee7cf6abd6c3da526834e6b71850c7edb52ac6c87b0d5d085","observation_id":"01912514-e6ff-413a-932d-456ba25297a3","resolution":{"observed_at":"2026-05-17T03:48:58.464790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Noisee ai: Ai music video generation platform","venue":null,"work_id":"2a8bf184-359f-4c64-99f5-59079bd284af","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:dbd5fe4271e50e56c30579dc5ee666c49d6c85fec2b6c47d73881a90a7c7a768","observation_id":"9b6a0c37-3867-4399-b1ea-385bc8941c5d","resolution":{"observed_at":"2026-05-17T03:48:58.721738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Veo3 ai: Advanced video generation platform","venue":null,"work_id":"48154ecb-d9f3-4f20-8801-6b1b5874ede8","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:ec9927c9c42c24eb35bb06ed976d8bc37bdccc83415c07b460b7c6324dcc22dd","observation_id":"ce423e2f-c8e2-4e01-88b7-b1ff7a154525","resolution":{"observed_at":"2026-05-17T03:48:58.675390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vidu: Ultra-realistic video generation model","venue":null,"work_id":"b7d4c523-f092-4534-9f49-e8b91f1c608e","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:60d0ef669da80949668b7d012c7c2ee03e3c2f105c04cfaddcca4b5ec198036c","observation_id":"1e84c879-3455-45d6-95db-6520b75a922e","resolution":{"observed_at":"2026-05-17T03:48:58.779587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Viva video ai: Ai video generation platform","venue":null,"work_id":"d156e4e9-d517-42fb-ba0f-dc5403a008a2","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:9bb94d66ca2113db57667b5bdc43479ffa780d26c127b4567cae0dc374d90107","observation_id":"e12fc069-f194-412e-a5ad-7646c49b25ec","resolution":{"observed_at":"2026-05-17T03:48:58.737094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":"2409.18869","doi":"10.48550/arxiv.2409.18869","metadata_source":"pith","pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emu3: Next-Token Prediction is All You Need","venue":"cs.CV","work_id":"720d288e-fac0-464c-9929-19efd9a52afc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:bc70fb7a59fee1f2ffef801c5ae2beffe01fbbe5c18f8991c26f0688164816af","observation_id":"8490cdfd-32df-451d-8825-b2c8c225a84b","resolution":{"observed_at":"2026-05-17T03:48:58.429877Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2307.06942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-07-04T06:39:37.513098Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","venue":"cs.CV","work_id":"e0787102-2f18-46ad-9660-6bfe466e3bbf","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:530634eab0c342ac4fa52396b81523f021171828cf347ae2746f4280c0cbf16d","observation_id":"aee86242-127c-4615-a89d-8336e02dae48","resolution":{"observed_at":"2026-05-17T03:48:58.512894Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":"ba7e9179-f130-46fc-9396-650377fa0674","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:03f9d6fe6978aa0a2f6fa7ace2cb0b7cd7927a054bcf26b59f2609241058a771","observation_id":"bfb542af-99c8-4afa-ae7d-4972022864fd","resolution":{"observed_at":"2026-05-17T03:48:58.751676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Art-v: Auto-regressive text-to-video generation with diffusion models","venue":null,"work_id":"1bb44fe8-38a2-466d-b71a-e7a2f39eacc9","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:9f5370fe393cc99f2ba0337e9955cb6dd5b9e8883c297d353d47cf85c49df512","observation_id":"99ec872a-2f0c-4b73-aa44-141f08650ff9","resolution":{"observed_at":"2026-05-17T03:48:58.695929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:39.639632Z","title":"UGC-VideoCaptioner : An omni ugc video detail caption model and new benchmarks","venue":null,"work_id":"3c348e09-df51-45d9-aade-df844c77a187","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:9313a1524dcd0cc589f456403ad8f621355b051d7c29f461c57c30f2423b45f6","observation_id":"40aa8e99-3fd4-4cdf-93de-2182c11273bb","resolution":{"observed_at":"2026-05-17T03:48:58.503202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MSR-VTT : A large video description dataset for bridging video and language","venue":null,"work_id":"23935bab-5883-49c2-9aa9-6566805d8cae","year":2016},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:638c4f3c4de24f57e658adf13487a28becc3648ad019e3f7172791dca77693b6","observation_id":"c245160a-4d9f-4606-b9ad-5db345a98370","resolution":{"observed_at":"2026-05-17T03:48:58.716384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":"3c4fd165-2a58-466d-af26-a61eb10205cf","year":2023},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:a3ff6ad06c2ab238133a3f3b270d92f71a1c3eeea2f5c8118b994916cb655d37","observation_id":"c7a10a39-8adf-49be-ae4f-c6ea8c30eaa1","resolution":{"observed_at":"2026-05-17T03:48:58.692452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-07T10:46:50.742580Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":"2407.01494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-07-08T07:14:45.319897Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":"cs.CV","work_id":"15978118-0cb9-48fb-8c66-d8f1ea7e79fc","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:03d11962d77f251fd60f8e45fb222a2420a5758fc4bd129215f08ce6ca5fe772","observation_id":"270cdb8c-cd4a-449e-b745-efa3bffbc071","resolution":{"observed_at":"2026-05-17T03:48:58.459651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Occworld: Learning a 3d occupancy world model for autonomous driving","venue":null,"work_id":"068268f6-fd18-480d-9634-bb8a07e596c3","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:270240437f57ef144820f4d57747d181b41444d4eea1130bb13d2046499caa9b","observation_id":"7f26f15f-5020-4141-ab57-831089f2ca56","resolution":{"observed_at":"2026-05-17T03:48:58.713578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":"2412.20404","doi":"10.48550/arxiv.2412.20404","metadata_source":"pith","pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora: Democratizing Efficient Video Production for All","venue":"cs.CV","work_id":"8b29ba7b-3d84-4281-85b7-9eaf905afd7f","year":2024},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:04eb6146082cab63d09ab89826cdcf3d32fd6140aa12ef52805e1b29fecd34bd","observation_id":"65f086f1-3f17-4604-8f29-e6c908eb2083","resolution":{"observed_at":"2026-05-17T03:48:58.522778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Harmonyset: A comprehensive dataset for understanding video-music semantic alignment and temporal synchronization","venue":null,"work_id":"efbe3785-04b7-4020-9158-6d369db783f0","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:4fa60d04cddad68f51370cf6ca3b3f80300d3130da7ae90c4e9135ce081cf5a2","observation_id":"91170183-a9de-4f74-aa59-24d9f9cb0632","resolution":{"observed_at":"2026-05-17T03:48:58.754656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:37:16.933664Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":38},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2512.00336."}