{"as_of":"2026-08-09T01:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f4fa39e546bf1c1a2924ae930a7241e9f4d588da168626a2ad83a09b608ffff","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:24:59.444766Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T00:05:47.808077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.703864Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-05T00:05:47.808077Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T00:05:47.808077Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2509.06155"},"observation_digest":"sha256:998b2ecd1212653fb11c9c8f5d248e0e872026aceebe6a01cad3528982b5cb36","observation_id":"823551b6-d303-469f-a713-b7cff82979e0","resolution":{"observed_at":"2026-08-05T00:05:47.808077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2510.01186","last_updated":"2026-04-14T16:17:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-01T17:59:56Z","title":"ASTRA: Let Arbitrary Subjects Transform in Video Editing","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:10.141426Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2510.01186"},"observation_digest":"sha256:1f3a4945b44869f0892869ec7153032a282152e6229783b2252659e492ac9b01","observation_id":"31fba0ea-5d3d-4267-8785-c127026cd2ba","resolution":{"observed_at":"2026-05-18T10:16:14.277804Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T20:39:16.078524Z","title":"Wan-S2V: Audio-driven cinematic video gener- ation.preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.19065","last_updated":"2026-05-25T08:00:25Z","snapshot_observed_at":"2026-08-07T16:28:04.884926Z","submitted_at":"2025-11-24T12:59:27Z","title":"Understanding, Accelerating, and Improving MeanFlow Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T20:39:16.078524Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2511.19065"},"observation_digest":"sha256:c05c05ba4813df48201737d8d141941c139e5d5240643a7e9d70276b04c3b672","observation_id":"6e6f1077-bff7-42c6-91f1-b22c9c3940db","resolution":{"observed_at":"2026-08-03T20:39:16.078524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:f83d79e1dd25697c668762e301f2fe95b4624c30b5fa312dd2056fe023f2220f","observation_id":"d3775d6b-28f1-4e2d-8dd4-07c78e054cc5","resolution":{"observed_at":"2026-05-17T01:58:51.463818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T18:39:41.295310Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.295310Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:81d8244dd3464c50fc619191690a0369fa4a594791e3e551e8879561196eb2cf","observation_id":"81c585a6-fcc6-41ec-8429-171803c4fc2b","resolution":{"observed_at":"2026-08-03T18:39:41.295310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T16:25:55.546710Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13677","last_updated":"2026-07-31T15:26:54Z","snapshot_observed_at":"2026-08-08T08:34:03.360784Z","submitted_at":"2025-12-15T18:58:18Z","title":"JoVA: Unified Multimodal Learning for Joint Video-Audio Generation and Editing","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:25:55.546710Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.13677"},"observation_digest":"sha256:915b37fbe5b519ca64ccbe3f5fcbd51443eaf18def0a655929cef7a84d3fb4b7","observation_id":"f1e3d810-2745-4a83-8ad8-805a95a82067","resolution":{"observed_at":"2026-08-03T16:25:55.546710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T07:06:20.470686Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2601.03233"},"observation_digest":"sha256:a362d450b7c67759e67cc9d478ee586e9561a2d497298106f4622a336ed395ab","observation_id":"c39098de-37ea-4f0a-9dee-cc030938ab7f","resolution":{"observed_at":"2026-05-13T07:06:20.610336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:c9bef44f033f2bc0750fb9bc29d1f97c2ff81138f444d8601f1cc97607671849","observation_id":"aeee2f62-f7d9-4b5a-93e4-43ba92da5b75","resolution":{"observed_at":"2026-05-16T05:50:40.238327Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:fb69f9c26757bf4e1e5c363354d27243d6041c8bfcf2f2bdc6e425be9fefffda","observation_id":"b2b5bc18-be68-4dac-98bf-d3478a9c8bab","resolution":{"observed_at":"2026-05-15T22:20:22.182089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:6dddfb24e68c9b99d3764fd49ab0e789568abb6f58b467b2c46ac9dd0577f10c","observation_id":"ed9b6ca1-feca-4e93-8d37-466dc6ccce21","resolution":{"observed_at":"2026-05-11T07:30:59.901752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.09057","last_updated":"2026-04-16T03:03:01Z","snapshot_observed_at":"2026-07-06T22:58:04.106299Z","submitted_at":"2026-04-10T07:37:03Z","title":"Tora3: Trajectory-Guided Audio-Video Generation with Physical Coherence","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:13:06.005185Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.09057"},"observation_digest":"sha256:f9b44577af980972619b687964935528fe545f50a6822e0d7e7ff8ffec541bb6","observation_id":"53a221fe-6b10-4d3c-91ec-02fc5e31bc78","resolution":{"observed_at":"2026-05-11T07:20:58.586177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:abed929e99c268fcb4d2ccef3b9303be10ca883f6ff3a6fe38088c528027d375","observation_id":"915f1fcc-8e73-4951-b8ff-7eabc64a9178","resolution":{"observed_at":"2026-05-11T12:41:04.221942Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-07T09:57:43.422059Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T16:54:23.108142Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.25819"},"observation_digest":"sha256:08eadf36ff53ac5fcb6ea103414fc24906e61adf53e10438b65f511aafc7d340","observation_id":"3ea3c7b8-d52c-47e6-9c48-0973c96485da","resolution":{"observed_at":"2026-05-11T23:31:14.635424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:dd1d996b3c27fea55421bfdb4122dcd75f35ae58549832dac44229c232e6415a","observation_id":"0615e64f-6599-41bd-83d8-5bcb33534e7c","resolution":{"observed_at":"2026-05-12T10:36:29.776769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.06192","last_updated":"2026-05-07T13:06:19Z","snapshot_observed_at":"2026-07-06T23:18:41.400741Z","submitted_at":"2026-05-07T13:06:19Z","title":"EA-WM: Event-Aware Generative World Model with Structured Kinematic-to-Visual Action Fields","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T13:50:37.638842Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.06192"},"observation_digest":"sha256:968804162e85739fda50cf0ed4f2b197cb94ff41486428f10a8a91f87e66b122","observation_id":"a3dc51c6-bb87-40c8-b871-35b2a91dfdc1","resolution":{"observed_at":"2026-05-11T18:51:06.456958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.11424","last_updated":"2026-05-12T02:20:31Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T02:20:31Z","title":"VidSplat: Gaussian Splatting Reconstruction with Geometry-Guided Video Diffusion Priors","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T02:00:29.091220Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.11424"},"observation_digest":"sha256:df589e2361f0cb63de49a7d608df95150f91308efd47de426d4aa3ec53eb2f73","observation_id":"37293b50-a45c-4a27-a122-eaa91e372b17","resolution":{"observed_at":"2026-05-13T02:02:06.244777Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:0e5998c043b0b76e8fd89c7739813b522789489890fed0fbf56630ba4a7e7708","observation_id":"85ee8bdd-7e3f-4f54-b055-863779596bf1","resolution":{"observed_at":"2026-05-20T14:13:21.362381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:f469e62245230f679e85068fc4e959b49477a289c69e866c9a43bd8e43516be9","observation_id":"fe6b0a7c-2970-472b-a76c-05962dcf8ef6","resolution":{"observed_at":"2026-06-29T22:24:00.909558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2605.26486","last_updated":"2026-05-26T02:54:12Z","snapshot_observed_at":"2026-08-03T07:56:02.917440Z","submitted_at":"2026-05-26T02:54:12Z","title":"LongCat-Video-Avatar 1.5 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:28:16.968339Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2605.26486"},"observation_digest":"sha256:9079054663438468fe1ec9b5b2fdba22879b323f4a7bb34758db4aba139c0a0f","observation_id":"39e56e96-9933-4318-b211-5bfd45fd9511","resolution":{"observed_at":"2026-06-29T18:33:50.607869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.13304","last_updated":"2026-06-11T13:00:58Z","snapshot_observed_at":"2026-08-02T06:04:04.601953Z","submitted_at":"2026-06-11T13:00:58Z","title":"ReFree: Towards Realistic Co-Speech Video Generation via Reward-Free RL and Multilevel Speech Guidance","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:56:35.931176Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.13304"},"observation_digest":"sha256:41f6595d5d421da656ad6d85c426703b655f0c94a6eed239b2812ea802bd680d","observation_id":"802dd96e-2a18-45e5-94a0-861643019afd","resolution":{"observed_at":"2026-07-03T14:48:32.705373Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-08T11:09:46.118421Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:35:58.943585Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.30019"},"observation_digest":"sha256:8c1d8774f004fbf8b56b3c777721bec4511318e5cb655ad15616e27c59fe2891","observation_id":"9adfd245-c7ea-4461-bb45-c772ba35572c","resolution":{"observed_at":"2026-06-30T06:44:19.552832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:db1294d6cf7b40d4ad088bc07d07554ab1052a069434db644bdb782cd5aa2270","observation_id":"abda8adc-4997-457f-95ab-4eb69b4bc66c","resolution":{"observed_at":"2026-07-01T09:45:40.338694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":"2508.18621","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-03T14:48:32.703864Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":"8c249dee-f8a5-4481-b937-c63159956885","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:2fac481a174447f90b2a23af2ed76df01df6069549ec8e57787dbfd6eaa635d8","observation_id":"e55d4727-a3f8-4397-a63d-f09874dc90a8","resolution":{"observed_at":"2026-07-02T13:16:58.093129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-12T04:46:57.581402Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-06T11:22:14.847939Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T04:46:57.581402Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:c417630e9274797a30fe9dbe7fb29deaf5b18a863717a344952680c4d598a1dd","observation_id":"6500ddfb-d75d-4892-a023-fe235c500c26","resolution":{"observed_at":"2026-07-12T04:46:57.581402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T08:56:31.525012Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-06T11:22:14.847939Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.525012Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e435f77321a9c1232db2fec26cb444c05c33cbf1795fd85e2ad70a4ed32ac1f9","observation_id":"f9925a27-de13-409c-9838-6f113ba0d756","resolution":{"observed_at":"2026-08-02T08:56:31.525012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-13T01:59:43.167178Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:43.167178Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:90e09d0d901ab11828210d8e0eac6b113776eb16ae8331b2de2b953e6149eedb","observation_id":"8d80c2af-be36-458f-a467-b2f597e4d5ab","resolution":{"observed_at":"2026-07-13T01:59:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-14T15:10:13.757131Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T15:10:13.757131Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:7a0dda8f869fd99203269472977890a63fd2aacc1a6efbe30a98223a352cae7c","observation_id":"96151756-fd25-4fe9-a567-e7ac1b8a8321","resolution":{"observed_at":"2026-07-14T15:10:13.757131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T07:35:22.880155Z","title":"arXiv preprint arXiv:2508.18621 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T07:35:22.880155Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:5360e63d16ea9054ddbe61970804464444c11bcc4e6e101b58b50af91c12521f","observation_id":"0db1233f-e7bb-4a10-bb85-3d0ff1a05a65","resolution":{"observed_at":"2026-08-02T07:35:22.880155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T23:18:59.468371Z","title":"2508.18621 , archivePrefix=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24013","last_updated":"2026-07-29T08:53:30Z","snapshot_observed_at":"2026-08-08T00:20:04.666794Z","submitted_at":"2026-07-27T05:21:40Z","title":"AptAvatar: Fast and Vivid Long-Form Audio-Driven Video Generation for Production-Ready Avatars","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T23:18:59.468371Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24013"},"observation_digest":"sha256:57fa796575972a2fc84182b90d20e53bc67dffb0d414fbe174c4cc58621e8085","observation_id":"51f7c75e-916d-4188-b3d9-db5c41a5be5a","resolution":{"observed_at":"2026-07-31T23:18:59.468371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T17:08:11.944416Z","title":"arXiv preprint arXiv:2508.18621 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-07T12:24:27.014006Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.944416Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3460daa611d2bba1dc205f1358ec9576b58f8c319623d23ce7ca6189e0aaf311","observation_id":"32ba9d0c-e283-4059-9009-9515cc4f2452","resolution":{"observed_at":"2026-07-31T17:08:11.944416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-04T01:32:13.104187Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-07T16:05:36.413106Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:13.104187Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:9095a374cc66617e9842d57f6a096d80d4004d21b8875b05c90165d3fea607e9","observation_id":"cbc871b1-6b14-47db-b6b1-2c0f3c82aaef","resolution":{"observed_at":"2026-08-04T01:32:13.104187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-04T06:45:46.515828Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.515828Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:88b1ae8055e9e6b2cf0fa698ea048480ce05c26cb22af19d9a1b31f711edf9eb","observation_id":"afd2025c-a931-4640-a65e-51dd3c8b3371","resolution":{"observed_at":"2026-08-04T06:45:46.515828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.18621/citation-record","integrity":"/paper/2508.18621/integrity","json":"/paper/2508.18621/citation-record.json","paper":"/paper/2508.18621"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T16:24:58.584884Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.584884Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:dbcd7650fc2c032420696206caaf0bd9f6c0cfc96b08649aee8ce606b8674a31","observation_id":"4968f6d7-9c97-4a4f-b775-bba1ef82af99","resolution":{"observed_at":"2026-08-05T16:24:58.584884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T16:24:58.824740Z","title":"Hui Li, Mingwang Xu, Yun Zhan, Shan Mu, Jiaye Li, Kaihui Cheng, Yuxuan Chen, Tan Chen, Mao Ye, Jingdong Wang, and Siyu Zhu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.824740Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:e6bce49aa3a6850aef6ecfa1f9bc12b9fd8c654c2d35a3ccb822735371819180","observation_id":"7fb76f94-98a9-4e52-b57a-a60ac840fe62","resolution":{"observed_at":"2026-08-05T16:24:58.824740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T16:24:58.874741Z","title":"Yaron Lipman, Ricky T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.874741Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:c36d600cceca31871e68c00d3aa1785378d6f6603d193921239ba3fb5028eeca","observation_id":"04bda69f-6eb3-4468-bb05-9d351ea780ed","resolution":{"observed_at":"2026-08-05T16:24:58.874741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-08T20:25:42.487197Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:24:59.025790Z","title":"Emo2: End-effector guided audio- driven avatar video generation, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.025790Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:96d98db0b32d68ef60319930fc39284808e402aff558b623f9e50a05b9700bbb","observation_id":"6897fdfb-9ade-43ff-a776-5b1078b0f010","resolution":{"observed_at":"2026-08-05T16:24:59.025790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T16:24:59.084742Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.084742Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:19c81dffbc3aae5ad3c35811cef8ff5622a51834beb99222ede54ca909ac99b7","observation_id":"3ae816ba-4882-42a5-9c5f-4b5e41715aa9","resolution":{"observed_at":"2026-08-05T16:24:59.084742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-07T16:08:04.554747Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-05T16:24:59.254749Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion syn- thesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.254749Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:26332e4236c429cfd9cbb3f2d6bb74e1b38ab898d62573c87c1bb02ea4822e48","observation_id":"54d8d8a5-a960-4da1-b302-d210086694cd","resolution":{"observed_at":"2026-08-05T16:24:59.254749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08260","last_updated":"2025-04-26T17:58:24Z","snapshot_observed_at":"2026-08-01T11:16:30.883699Z","submitted_at":"2024-10-10T17:57:49Z","title":"Koala-36M: A Large-scale Video Dataset Improving Consistency between Fine-grained Conditions and Video Content","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08260","snapshot_observed_at":"2026-08-05T16:24:59.301375Z","title":"Zhou Wang, A.C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.301375Z"},"links":{"cited_paper":"/paper/2410.08260","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:5dfebbcd3d3b419f573c9e5804b6b583777fd8d029c027a2f753bdde467a93d1","observation_id":"163e6c2f-8abb-466f-b17d-b21ee7be9c84","resolution":{"observed_at":"2026-08-05T16:24:59.301375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-05T16:24:59.444766Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guid- ance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.444766Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:3dc7e8a14a86e1b723879c3b94954bc0a107d61d226dbb23ffd85dbf0f80acd3","observation_id":"0ac0e266-00bd-4c76-9f87-ba7e83315f05","resolution":{"observed_at":"2026-08-05T16:24:59.444766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:59.354746Z","title":"Haoning Wu, Erli Zhang, Liang Liao, Chaofeng Chen, Jingwen Hou Hou, Annan Wang, Wenxiu Sun Sun, Qiong Yan, and Weisi Lin","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.354746Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:c8464a6bd74958d787e253f8d309a5796635588568ac4835697ae4d6f2f62b51","observation_id":"13af52ce-5fa9-44ae-8acb-0f90b09b0c9c","resolution":{"observed_at":"2026-08-05T16:24:59.354746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:58.774990Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.774990Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:a7d97c9c6d1cd88c9322b50d7ba3238a426733dea4df028070b7a84c1d247146","observation_id":"ca1bd54f-4053-41a3-b5f2-245a5bca4ded","resolution":{"observed_at":"2026-08-05T16:24:58.774990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:24:58.974740Z","title":"Christoph Schuhmann","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.974740Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:0003848099ff3b97c42c57aaabe68f46ccf821c4ccd89f4c8ab3e517e17118bb","observation_id":"b7516b7e-1033-429c-b33c-0060dd4bfa65","resolution":{"observed_at":"2026-08-05T16:24:58.974740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:25:01.954747Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"dc933355-7415-4909-833c-21f192dc59e0","year":2010},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.724742Z"},"links":{"citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:25d55d5c012bb621d363b4c9fd139c9c2c0b4bb6566d4e7fed21b53e1130620b","observation_id":"b29b68cb-f0fc-44d7-9b16-1208154a8507","resolution":{"observed_at":"2026-08-05T16:25:02.079683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.12484","last_updated":"2022-10-13T01:53:23Z","snapshot_observed_at":"2026-08-08T16:43:13.815044Z","submitted_at":"2022-04-26T17:55:04Z","title":"ViTPose: Simple Vision Transformer Baselines for Human Pose Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.12484","snapshot_observed_at":"2026-08-05T16:24:59.404743Z","title":"Zhendong Yang, Ailing Zeng, Chun Yuan, and Yu Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:59.404743Z"},"links":{"cited_paper":"/paper/2204.12484","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:8f1ee5ec97a9f73ad487c757d0cd96b5cfe96d6f067e61a28fb330109b7c5dc6","observation_id":"d77ea705-6962-4e0f-b2a1-7babb4f8852b","resolution":{"observed_at":"2026-08-05T16:24:59.404743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T16:24:58.924743Z","title":"Rang Meng, Xingyu Zhang, Yuming Li, and Chenguang Ma","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.924743Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:1651e85eae7f6e05a01e6a41eb2ca5a04169357b0ec80c9dec1425666bffb9f9","observation_id":"90c58207-0cbf-4150-bb93-e2f38d6b30c1","resolution":{"observed_at":"2026-08-05T16:24:58.924743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-05T16:24:58.674741Z","title":"Martin Heusel, Hubert Ramsauer, Thomas Unterthiner, Bernhard Nessler, and Sepp Hochreiter","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.674741Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:71c5d1bdfa7403261ab3427f15918a2684ff13942e2ab8c10a48636e24ec6d5d","observation_id":"d377db72-a42b-49dc-a21b-bcd2603004dc","resolution":{"observed_at":"2026-08-05T16:24:58.674741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T16:24:58.625126Z","title":"9 Joon Son Chung and Andrew Zisserman","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T16:24:58.625126Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.18621"},"observation_digest":"sha256:2c1be9e05fa3d77217958b2e5e6e43ee05adcf443229be887cf142727f6eb8b1","observation_id":"3e091873-51f3-4079-b666-ccbce3d342bf","resolution":{"observed_at":"2026-08-05T16:24:58.625126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:23:53.377738Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 32 inbound Pith citation observations for arXiv:2508.18621."}