{"as_of":"2026-08-18T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31227adfb0cc7666b326052bd5f39fac05acbb765523fb6262095f092b6eb4b4","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:56:31.626723Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:52:49.585526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T04:52:50.130247Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.03118","snapshot_observed_at":"2026-07-30T23:47:57.729629Z","title":"Vidu s1: A real-time interactive video generation model,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26694","last_updated":"2026-08-17T13:29:53Z","snapshot_observed_at":"2026-08-18T07:17:26.252653Z","submitted_at":"2026-07-29T09:40:23Z","title":"Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T23:47:57.729629Z"},"links":{"cited_paper":"/paper/2607.03118","citing_paper":"/paper/2607.26694"},"observation_digest":"sha256:c5be92ee388a540ff54b9dff7f0d07838c324123ab83ae61cfee2f9a4ad85314","observation_id":"07857c41-bc51-4ef3-80d4-f446320f17d1","resolution":{"observed_at":"2026-07-30T23:47:57.729629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"cited_work":{"arxiv_id":"2607.03118","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.03118","snapshot_observed_at":"2026-08-05T04:52:50.130247Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","venue":"cs.CV","work_id":"e2fbb4bc-6939-4266-847d-fc26bd69671b","year":2026},"citing_paper":{"arxiv_id":"2608.03974","last_updated":"2026-08-04T17:40:48Z","snapshot_observed_at":"2026-08-07T23:12:45.946866Z","submitted_at":"2026-08-04T17:40:48Z","title":"JoyAI-Video-Edit: Real-Time Open-Ended Video Editing with Autoregressive Diffusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T04:52:49.585526Z"},"links":{"cited_paper":"/paper/2607.03118","citing_paper":"/paper/2608.03974"},"observation_digest":"sha256:4ff1fbb2ccb57cb1953910cd80c3e9a3385e3d77be90033373fa07bc654cc6f3","observation_id":"8c4e5496-cf18-4387-9ff8-e09321f7374c","resolution":{"observed_at":"2026-08-05T04:52:50.219179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.03118/citation-record","integrity":"/paper/2607.03118/integrity","json":"/paper/2607.03118/citation-record.json","paper":"/paper/2607.03118"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.463504Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.463504Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f2cb05d7076dd06686f88facfdfa782af0b32c78b7cd0938bc21150959729216","observation_id":"3e363ebb-bca1-4d0b-a364-4ccab1a3f003","resolution":{"observed_at":"2026-08-02T08:56:31.463504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.467458Z","title":"Veo: A text-to-video generation system","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.467458Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:34eeb0513d518c9b19ef7a873068e480dcb6d8c7b9a6fff3b6301d664056af84","observation_id":"3aeb8d28-103a-4275-8e24-ceb48a86870c","resolution":{"observed_at":"2026-08-02T08:56:31.467458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-02T08:56:31.470703Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.470703Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7e79e1dfdac21d1a700251e170cdd4f9c98fa54e0649532c24c347e6b41acfb0","observation_id":"cab3bf8a-6dcd-4df4-9eef-844027cd223d","resolution":{"observed_at":"2026-08-02T08:56:31.470703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-16T18:58:56.056540Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-02T08:56:31.474238Z","title":"Seedance 2.0: Advancing video generation for world complexity","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.474238Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:b8c2968ae99d7cef2de20d6a9a8370b844bc1b6f123478587650650a04a9f076","observation_id":"d3c08625-a7aa-4c0a-be1f-03b1b8be0acf","resolution":{"observed_at":"2026-08-02T08:56:31.474238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.477580Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.477580Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:2e8de16c3e61cd73dd20c589cbca634490b91f5894dac0f78ab452d4709dc2d8","observation_id":"ecccb5ee-80b0-48a0-a499-e5cf55ef0736","resolution":{"observed_at":"2026-08-02T08:56:31.477580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.480537Z","title":"Fifo-diffusion: Generating infinite videos from text without training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.480537Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:27daaccaf0b88aa1f9a88c0c24bc37cf907b2539c5c754046c91732b0ef962cd","observation_id":"b6abb58f-af3c-4794-80ac-d74398402727","resolution":{"observed_at":"2026-08-02T08:56:31.480537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.483719Z","title":"Streamingt2v: Consistent, dynamic, and extendable long video generation from text","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.483719Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:36bba18eae439e6eaae0260de3dfede68f16c48acd69ae128b7da9cab5955670","observation_id":"ff47484f-91e5-47ee-ace7-21a04e51327f","resolution":{"observed_at":"2026-08-02T08:56:31.483719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06764","last_updated":"2025-07-24T03:58:47Z","snapshot_observed_at":"2026-08-13T16:17:52.423891Z","submitted_at":"2025-02-10T18:44:25Z","title":"History-Guided Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06764","snapshot_observed_at":"2026-08-02T08:56:31.486576Z","title":"History-guided video diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.486576Z"},"links":{"cited_paper":"/paper/2502.06764","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:79fec77fc4032048e78d4d3432c5f05cf49c3b20eabbe2c94a60dc1289f178cb","observation_id":"581655c9-ad42-4b91-8ac9-1c790b4fdbe3","resolution":{"observed_at":"2026-08-02T08:56:31.486576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-08-09T09:15:39.740119Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-08-02T08:56:31.489618Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.489618Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:f29bf6d599f2747b9d3f082f0a0249480c6660ea1665235aea67dca48cb6d5c1","observation_id":"c4b0d531-7a5c-4974-a016-ad469f72aa68","resolution":{"observed_at":"2026-08-02T08:56:31.489618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.492622Z","title":"Ar-diffusion: Asynchronous video generation with auto-regressive diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.492622Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:b055a7ecd8b26e15ab959b2049d771274b15a8ffb3b956b664efe28d716a6159","observation_id":"0c05cea9-6547-4cc4-ac7f-d63ab2c9fc8e","resolution":{"observed_at":"2026-08-02T08:56:31.492622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.495691Z","title":"Progressive autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.495691Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:562ca7abfeae28dd76e0271c2e0b91952d860ceeccb7f2003b295ceb51ebfbf7","observation_id":"b2c57829-ae31-4cc4-ba59-fdf2bc436448","resolution":{"observed_at":"2026-08-02T08:56:31.495691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.498709Z","title":"Streamdiffusionv2: A streaming system for dynamic and interactive video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.498709Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:84dc04d530a89316434aa96314d00eea76cb93e5e8425420d0146e5c19c4f2f7","observation_id":"5d57c7ad-8073-405f-8070-3b48af4375bd","resolution":{"observed_at":"2026-08-02T08:56:31.498709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.501590Z","title":"From slow bidirectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.501590Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e61d3eb14a12df1f268a4c51f745f50b159893f390dad5912386ed5f8c853525","observation_id":"c4a4b9e2-570e-40f6-b829-1a6faac2be07","resolution":{"observed_at":"2026-08-02T08:56:31.501590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.504457Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.504457Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7e92703159ec013ed32a75b5b1b187efcec0e60942d35c8f66b0635520c6d22d","observation_id":"067a425a-2ee4-429b-8fc8-d83be035a332","resolution":{"observed_at":"2026-08-02T08:56:31.504457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-17T22:01:08.736822Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-08-02T08:56:31.507401Z","title":"Causal forcing: Autoregressive diffusion distillation done right for high-quality real-time interactive video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.507401Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:805267c40756656cac6fb7b8183c8a03fe6516459767404f8063b12673f420ee","observation_id":"3248f336-7196-4c2b-a7a5-984225c59fa5","resolution":{"observed_at":"2026-08-02T08:56:31.507401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15141","last_updated":"2026-06-01T14:27:49Z","snapshot_observed_at":"2026-08-14T11:03:14.501844Z","submitted_at":"2026-05-14T17:46:36Z","title":"Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15141","snapshot_observed_at":"2026-08-02T08:56:31.510408Z","title":"Causal forcing++: Scalable few-step autoregressive diffusion distillation for real-time interactive video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.510408Z"},"links":{"cited_paper":"/paper/2605.15141","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:216e76ae716d3d0ad07f70b0d90ef3b6ea6137c2c6066b529e1694f89fd0badd","observation_id":"348b9833-f2b8-4e1b-a326-4bcb07919cf1","resolution":{"observed_at":"2026-08-02T08:56:31.510408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-08-02T08:56:31.513461Z","title":"Longlive: Real-time interactive long video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.513461Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e17bde09632a406128bfcf17ab265ec70c9fcaa6c0414309a6531d2f22bd69ae","observation_id":"bc26c285-1f33-44d8-af4e-02ca1c9744fc","resolution":{"observed_at":"2026-08-02T08:56:31.513461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-08-17T23:27:13.017878Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-02T08:56:31.516388Z","title":"Magi-1: Autoregressive video generation at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.516388Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3b1c24c410fc3fa1d518f9810635aa8c10c3d88cca592340008d74f18c101eac","observation_id":"a82db0fd-a0c7-46b3-b959-ff2f213dfb0c","resolution":{"observed_at":"2026-08-02T08:56:31.516388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-08-15T13:01:37.943884Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-02T08:56:31.519369Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.519369Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:d891b47869cae270a8b1bb786b3de1c3f39b1e47b636d0160ca97e80e207a01d","observation_id":"f7ef0785-6436-4487-a2d4-6e82a188ba99","resolution":{"observed_at":"2026-08-02T08:56:31.519369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.522348Z","title":"Packing input frame context in next-frame prediction models for video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.522348Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:fda06a4e1e03020c2cb2c69b58d6c0c72fec64715c19e65d4238cea6a412b44a","observation_id":"2218d08e-c25b-4132-993c-bcb47a358fec","resolution":{"observed_at":"2026-08-02T08:56:31.522348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-15T01:56:17.706891Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-02T08:56:31.525012Z","title":"Wan-s2v: Audio-driven cinematic video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.525012Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:40244d23d9443853e7ad30a65a611d6c96ceefa631a637843777069213ab0718","observation_id":"f9925a27-de13-409c-9838-6f113ba0d756","resolution":{"observed_at":"2026-08-02T08:56:31.525012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.527895Z","title":"Turbodiffusion: Accelerating video diffusion models by 100-200 times","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.527895Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:789f72ee547141dd1d3ad4e04efbf7e4087ad8527aee0eb9018239967475579e","observation_id":"2bd93fa1-c131-48d6-95ee-b48d84c7e2b8","resolution":{"observed_at":"2026-08-02T08:56:31.527895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.19271","last_updated":"2026-06-17T16:48:36Z","snapshot_observed_at":"2026-08-15T14:17:44.118375Z","submitted_at":"2026-06-17T16:48:36Z","title":"TurboServe: Serving Streaming Video Generation Efficiently and Economically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19271","snapshot_observed_at":"2026-08-02T08:56:31.530403Z","title":"Turboserve: Serving streaming video generation efficiently and economically","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.530403Z"},"links":{"cited_paper":"/paper/2606.19271","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:aa2922db2a13d28218565c1030b47cb68119e136985ba9f0ec72822aadbe0774","observation_id":"91a812e8-d2b7-461d-ba52-e2324aa14959","resolution":{"observed_at":"2026-08-02T08:56:31.530403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-02T08:56:31.533158Z","title":"Qwen3-omni technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.533158Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:014c6bbc9d18c3001ac0fba0f781825ce27e7ea6801b5e98afde15477d53fd6f","observation_id":"80dde387-c348-401a-89c8-e55c6bc8a88a","resolution":{"observed_at":"2026-08-02T08:56:31.533158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-02T08:56:31.535865Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.535865Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0caf4a4a60a0e719de929b9dd70e8a5b35a700eca125dbb5446f5570553d0371","observation_id":"c5e46572-31eb-402d-8272-29e4bf9de353","resolution":{"observed_at":"2026-08-02T08:56:31.535865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.538797Z","title":"Ca2-vdm: Efficient autoregres- sive video diffusion model with causal generation and cache sharing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.538797Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:6463b59f56d16edf3a138e7c0d73e6f1601b4b522c3db573ef92143e0b065125","observation_id":"90abec4b-4c0b-4ca5-830a-35c121473a6d","resolution":{"observed_at":"2026-08-02T08:56:31.538797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.541421Z","title":"Pyramidal flow matching for efficient video generative modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.541421Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:628321e0e7540fa9ba7f067ed5ac9392261c0b51c6e424d75b06dc4d7ac6f8df","observation_id":"844b100c-1434-4ba1-be53-fb5578ab5542","resolution":{"observed_at":"2026-08-02T08:56:31.541421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.543850Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.543850Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:97cfa0d60649d0c19e13cb05544ff806eff474c4b496facc92550b4360a7f554","observation_id":"f53fc15a-4014-4084-926d-6038ff82afdd","resolution":{"observed_at":"2026-08-02T08:56:31.543850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.546327Z","title":"Phased consistency models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.546327Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:76835fa3d2554de4e75bacff96d1c3d6fe70b5aee5c98c829724baa524490c74","observation_id":"e483012a-357b-4ffd-a522-b4d0a5dd4aa3","resolution":{"observed_at":"2026-08-02T08:56:31.546327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.548773Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.548773Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:37e858d6761477ab1d202bbeba0b18e0194d1dc433950de7213f20298886b845","observation_id":"32310bdd-18a0-4d66-8659-30afe28ceb70","resolution":{"observed_at":"2026-08-02T08:56:31.548773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.551331Z","title":"Infinity-rope: Action-controllable infinite video generation emerges from autoregressive self-rollout","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.551331Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:4dbcd6e5bd0bc67cc040006b16e1778f8511fd07c3aefc805d70572064376289","observation_id":"a3526f36-03ed-4c48-8697-14a7388cfa1f","resolution":{"observed_at":"2026-08-02T08:56:31.551331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.553831Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.553831Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0c1f492592d345187a4ab3b63d12253f21982e26511d262157677ca181e50596","observation_id":"20b37558-ec6d-4ac8-856c-26e2e753c268","resolution":{"observed_at":"2026-08-02T08:56:31.553831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.556217Z","title":"Deep forcing: Training-free long video generation with deep sink and participative compression","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.556217Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3ed688bbeff7dad00bdd3cdebe44de99735ae45b3c4e0c61d8655140be2185e9","observation_id":"d3d86871-2b0a-4c2d-b6c6-f19a4c8bd6ab","resolution":{"observed_at":"2026-08-02T08:56:31.556217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-08-15T00:49:04.808892Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.07775","snapshot_observed_at":"2026-08-02T08:56:31.558808Z","title":"Rolling sink: Bridging limited-horizon training and open-ended testing in autoregressive video diffusion","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.558808Z"},"links":{"cited_paper":"/paper/2602.07775","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:16edd8fff99a5e2120594e5df5cbb35a4a427eb97c6262d851a896907559ed5a","observation_id":"3a63176c-696c-445e-ba39-027af13592af","resolution":{"observed_at":"2026-08-02T08:56:31.558808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06939","last_updated":"2026-04-13T17:35:53Z","snapshot_observed_at":"2026-08-12T17:34:18.419563Z","submitted_at":"2026-04-08T11:03:22Z","title":"Grounded Forcing: Bridging Time-Independent Semantics and Proximal Dynamics in Autoregressive Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06939","snapshot_observed_at":"2026-08-02T08:56:31.561574Z","title":"Grounded forcing: Bridging time-independent semantics and proximal dynamics in autoregressive video synthesis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.561574Z"},"links":{"cited_paper":"/paper/2604.06939","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:cdcd6022cd187d450360134d963f5548de389c518ef0d7d821f005281943c571","observation_id":"fc8ac0a1-ce5a-4ddc-a3f6-eeeeb1e2d13f","resolution":{"observed_at":"2026-08-02T08:56:31.561574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.564278Z","title":"Memrope: Training-free infinite video generation via evolving memory tokens","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.564278Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:de0b82024133499de0212c0a73395bcc5c4e7bb247ebb0c2388cfa320dd58123","observation_id":"f8ad4ad4-25dd-4bc8-9e75-e6d9a8d17dd9","resolution":{"observed_at":"2026-08-02T08:56:31.564278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-02T08:56:31.566881Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.566881Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:9e84d7df1a6cebcb70ca6ad8278117b4c1e2fde8a06241af11206fe7e691b8e2","observation_id":"40026c4a-3386-4c42-9dce-a3c30f010f97","resolution":{"observed_at":"2026-08-02T08:56:31.566881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-08-05T22:45:50.916812Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.25473","snapshot_observed_at":"2026-08-02T08:56:31.569666Z","title":"Causal-rcm: A unified teacher-forcing and self-forcing open recipe for autoregressive diffusion distillation in streaming video generation and interactive world models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.569666Z"},"links":{"cited_paper":"/paper/2606.25473","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:89b152ce18a944a252d81d0ac05a16532d6b8545bec3ed20df89973821ec71b1","observation_id":"9b39dc43-2355-46b4-a07e-7ba9e4f8bba1","resolution":{"observed_at":"2026-08-02T08:56:31.569666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-08-12T18:55:29.657974Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07823","snapshot_observed_at":"2026-08-02T08:56:31.572316Z","title":"Lpm 1.0: Video-based character performance model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.572316Z"},"links":{"cited_paper":"/paper/2604.07823","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:077b223efca8b6d27ba685772949211282f1fa570a15d6abc1094b34316b820d","observation_id":"4d6cf2d9-c8ad-4f51-90cd-55ef574df26e","resolution":{"observed_at":"2026-08-02T08:56:31.572316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.575254Z","title":"Efficient attention methods: Hardware-efficient, sparse, compact, and linear attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.575254Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:ff0f98a7f0836b5950a2ed16341ab5074dfe342acd33ec9b0e93ec3ea56ac445","observation_id":"a5fbe3e1-45f0-46e9-9495-94e6005945bc","resolution":{"observed_at":"2026-08-02T08:56:31.575254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.577869Z","title":"Sageattention: Accurate 8-bit attention for plug-and-play inference acceleration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.577869Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:271f7a41e6a21be9123798647bfd8ab1c6f6eac9045f3f0b52c5fda8e5724efe","observation_id":"aea88014-b7a7-4c7a-b921-e7557d3be766","resolution":{"observed_at":"2026-08-02T08:56:31.577869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.580166Z","title":"Sageattention2: Efficient attention with thorough outlier smoothing and per-thread int4 quantization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.580166Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:79eb7e2d175ce117cc0b7bf9cb0647e95c3bed007b2a46aef098b25c089693d9","observation_id":"89b775ef-041d-4a9c-b2e2-24aa4c7dd394","resolution":{"observed_at":"2026-08-02T08:56:31.580166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21136","last_updated":"2025-06-06T07:47:22Z","snapshot_observed_at":"2026-08-16T01:38:34.028448Z","submitted_at":"2025-05-27T12:50:36Z","title":"SageAttention2++: A More Efficient Implementation of SageAttention2","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21136","snapshot_observed_at":"2026-08-02T08:56:31.582638Z","title":"Sageattention2++: A more efficient implementation of sageattention2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.582638Z"},"links":{"cited_paper":"/paper/2505.21136","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:7846b20dee7ec7876be92348e7e61545284614afd80ab66aaaf7e55a3170b797","observation_id":"c63f6e16-8a37-4f22-ad1a-41449ec5fce3","resolution":{"observed_at":"2026-08-02T08:56:31.582638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.585274Z","title":"Sageattention3: Microscaling fp4 attention for inference and an exploration of 8-bit training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.585274Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:01ccfc85d89dedb7a1329d1b9c9daf250a97b8a5a5229888fa92299d6e2464b0","observation_id":"12bb74d1-4e59-4bca-9baa-a160ba739091","resolution":{"observed_at":"2026-08-02T08:56:31.585274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.587582Z","title":"Sagebwd: A trainable low-bit attention","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.587582Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:e75f1ba64165ece44ea7637d14ad83d9319e3b9e5d16b26cc32c859eca0db1e7","observation_id":"89b897d3-425f-466e-9771-2ae98351a798","resolution":{"observed_at":"2026-08-02T08:56:31.587582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.589966Z","title":"Spargeattention: Accurate and training-free sparse attention accelerating any model inference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.589966Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:79f31fd6248009336e3184dd73c0d6baa1199ed31c7c67595936d8719573f702","observation_id":"e2343944-edae-4aab-9f22-0a80487b7aca","resolution":{"observed_at":"2026-08-02T08:56:31.589966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.592261Z","title":"Spargeattention2: Trainable sparse attention via hybrid top-k+ top-p masking and distillation fine-tuning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.592261Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:896602dc2141601127ddfeeb8fc3dddfbd83723b2d18a73dae9df2ac566028ee","observation_id":"585f5161-1ea3-4582-bcb9-015ff28b0062","resolution":{"observed_at":"2026-08-02T08:56:31.592261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.594594Z","title":"Gonzalez, Jun Zhu, and Jianfei Chen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.594594Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:8b3e2c091dec6ac58889b796ae395998bb396c1d0bdc146f42aef5eb5a82e1b3","observation_id":"26d5b5f4-4764-4b0e-a758-e474bc62ee61","resolution":{"observed_at":"2026-08-02T08:56:31.594594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.596847Z","title":"Sla2: Sparse-linear attention with learnable routing and qat","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.596847Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:42789a3d8a68246082361b1dbb81e751e119a54922ba6a58d4753dec6a3fbf76","observation_id":"e94ba322-1a22-4e46-817b-4fe618e2438c","resolution":{"observed_at":"2026-08-02T08:56:31.596847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-13T22:49:56.824755Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-02T08:56:31.599291Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.599291Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:9eef94e53d5b25b9a63f2605d0fde7871fc8d7bb5bd2fc63a4188c9c3c6bf671","observation_id":"880d7b0c-8379-4b62-ba22-fee057930146","resolution":{"observed_at":"2026-08-02T08:56:31.599291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.601964Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.601964Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:fc2afad0dc3d03aa4c4c5a04f2f57cc95e7f375c9fa2732c63b45f843d45e763","observation_id":"ec607be8-1c1d-4669-bcc2-c93d41decb29","resolution":{"observed_at":"2026-08-02T08:56:31.601964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.604304Z","title":"Heygen ai video avatar","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.604304Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3a8302a46e3da2c019297a782b230af015abd914617b3a051ee190abb549c734","observation_id":"b0ef7be3-eaa4-4688-8e47-b50b0d1cae7e","resolution":{"observed_at":"2026-08-02T08:56:31.604304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.606615Z","title":"Lemonslice studio: Create talking and singing ai avatar videos","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.606615Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:9b23a9141323c78fd4df53529d5de2d3bdbed220109c76e4e8b5beff3a507956","observation_id":"a1cfbc37-775c-4c06-b731-a8d685c99c37","resolution":{"observed_at":"2026-08-02T08:56:31.606615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.611583Z","title":"Klingavatar 2.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.611583Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:26b6daa60afb122bc1cda4e6549161d8899f0f6494fbc545211f0ef5bd224e41","observation_id":"21712d40-31e3-45b6-a168-1421154120c9","resolution":{"observed_at":"2026-08-02T08:56:31.611583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-15T18:39:33.154486Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-02T08:56:31.614075Z","title":"Omniavatar: Efficient audio-driven avatar video generation with adaptive body animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.614075Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a06a2ef4863014ae1d43059b7ef94f2bd6c2aca719e8a01530c7126972e3337f","observation_id":"0d4e942e-947d-46e0-95e1-092e8fcd4b2d","resolution":{"observed_at":"2026-08-02T08:56:31.614075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.616682Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.616682Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:da1d54f74601c13620d76f76123e913d1cd4c16b362f45fc80ba98ec47d92290","observation_id":"8f59d1de-8a7f-4be0-ae84-aaea78b0a6da","resolution":{"observed_at":"2026-08-02T08:56:31.616682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-18T02:40:00.948380Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-02T08:56:31.619017Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.619017Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3f321d58081a9782ff63878ce69f88a2fc965a98258c03fbe513f32a26fe053e","observation_id":"62419ab1-da7b-4530-bc99-fb8a4f8b7e7d","resolution":{"observed_at":"2026-08-02T08:56:31.619017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.621637Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.621637Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:5343a117aaece50ba4eb4ea5dc5c433f1cf829c86338a9e535cc06b05fc2c676","observation_id":"cf1e41b7-bd69-4204-bff0-6aa2dc81e491","resolution":{"observed_at":"2026-08-02T08:56:31.621637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.624150Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.624150Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:0191a67bfb45249858382828de7fa15fc16e693e1202d7bad9bd1f414f10e9d7","observation_id":"e8267e36-cfb7-4f07-ad67-2fe614302a9a","resolution":{"observed_at":"2026-08-02T08:56:31.624150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.626723Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.626723Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:a6abce4e1fc0b48b5639c0e23e2cdc43f51c039ce5896927c249db2fb77cd44f","observation_id":"0a2c29d2-6d73-401b-937d-778037eea38a","resolution":{"observed_at":"2026-08-02T08:56:31.626723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:56:31.609050Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.609050Z"},"links":{"citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:1b526e27dd7c2442adb0baabaaf720c6691b7251c41268721849bd7d213c19e1","observation_id":"dea6cf42-a1ea-4d65-850d-f2713d97858c","resolution":{"observed_at":"2026-08-02T08:56:31.609050Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":60,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 2 inbound Pith citation observations for arXiv:2607.03118."}