{"as_of":"2026-08-09T21:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:028dec10e7f91a14606e9b79b5752ae72cce104e106f672d3cf91e392cedf3a1","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:13:58.243293Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:49:45.075199Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.653031Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-06T17:49:45.075199Z","title":"Talkingmachines: Real- time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-08-06T17:43:06.615236Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:45.075199Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2507.09862"},"observation_digest":"sha256:ec9fa1b4665b64dce989b5af4f9de30d15889a2b69b9cfd6fbfce169ed0937e3","observation_id":"9a0ede31-7c2c-4aaf-ade2-f04637144bc7","resolution":{"observed_at":"2026-08-06T17:49:45.075199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-05T16:01:30.768612Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.768612Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:98052518e8202b2a015b8e66a721defd8c161eb1c12ac61b7507c0c1d24175e1","observation_id":"fe4cfe71-a521-4a47-b5ef-56faa10a8e68","resolution":{"observed_at":"2026-08-05T16:01:30.768612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:b6682e1b3dd457ed9342acb226efd2e09fb30e5fd217670269ade0d3846085fd","observation_id":"f1ed816c-b2b5-481e-9245-bf9d2eeba0e2","resolution":{"observed_at":"2026-05-17T01:03:15.270808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:9c0ce52fffb45fd4e4938dd7432431570a229adc879b7f41261cb139ed53ab76","observation_id":"01cebfeb-107d-4571-a151-bcf6615959b0","resolution":{"observed_at":"2026-05-17T01:58:51.445487Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-03T18:39:41.890004Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.890004Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:a6c24f847364232d1900c712028ab2acc4af1cd493432f6141d554b63d52c6c2","observation_id":"4a3213b5-584f-4e40-8b81-1465a29f7d90","resolution":{"observed_at":"2026-08-03T18:39:41.890004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-03T13:04:40.773631Z","title":"Talkingmachines: Real- time audio-driven facetime-style video via autoregressive diffusion models.arXiv preprint arXiv:2506.03099, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.00664","last_updated":"2026-05-30T08:41:30Z","snapshot_observed_at":"2026-08-05T17:56:34.094236Z","submitted_at":"2026-01-02T11:58:48Z","title":"Avatar Forcing: Real-Time Interactive Head Avatar Generation for Natural Conversation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T13:04:40.773631Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2601.00664"},"observation_digest":"sha256:3224a2fd81b4c58e65b3dfa4c1524042d02d5e2ecfc586e41ae0aaf5f2344915","observation_id":"de620223-5563-46f0-a22e-37ff66af5d5f","resolution":{"observed_at":"2026-08-03T13:04:40.773631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2602.07775","last_updated":"2026-05-03T01:49:14Z","snapshot_observed_at":"2026-07-30T09:22:37.641917Z","submitted_at":"2026-02-08T02:16:02Z","title":"Rolling Sink: Bridging Limited-Horizon Training and Open-Ended Testing in Autoregressive Video Diffusion","version":6},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T07:02:38.876518Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2602.07775"},"observation_digest":"sha256:29019619b667ae59f034c08dbc2c7064aa86a238d19f21a0aa770ab2a29c828b","observation_id":"27bc7c80-632f-4dde-a893-ec739075638f","resolution":{"observed_at":"2026-05-16T07:07:29.811065Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:3441ab04d7c5576c2a372bee0076b4e2db9c72e1b34fc1b21ca69bd4a17af040","observation_id":"8c2b8408-c1d2-412c-a640-b66edd062f47","resolution":{"observed_at":"2026-05-11T07:30:59.749809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:052747df914406c387f965ccfd843022fcb1fe6c6dd6fcbdecc7c977a751614e","observation_id":"89931edb-4006-4421-83fe-abdf5621cfe1","resolution":{"observed_at":"2026-05-10T09:03:25.925005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-08-07T16:28:09.434053Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:078b3d2d5069fea2b3d78db89504e6936eedf83a7758ecdb0128de900fcc212b","observation_id":"d46b214c-f9ee-4c93-ba81-3dab2d71ab11","resolution":{"observed_at":"2026-05-11T12:31:04.247728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:43eec23a758e326177ca6ab815e505c99c0706ac735274614ea067e413b8b09d","observation_id":"236a9de2-7f14-49b4-af42-24272acc0e49","resolution":{"observed_at":"2026-05-20T15:08:25.053134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-08-07T22:55:26.112965Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:4dbf972fd3becd80ae077e25286681013fb6aabfc3f02808ecbe921074139d8a","observation_id":"8824b76c-9096-4e16-acbf-911c9d25e250","resolution":{"observed_at":"2026-07-01T22:06:17.028231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-05T18:57:39.905774Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:e21b4050b59b7efa2f724dc638dc287d3d9530d34262dec13870437a61273495","observation_id":"ffbd3f46-e128-4644-a43e-155a3cff8aa1","resolution":{"observed_at":"2026-07-04T10:09:44.588704Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-05T18:57:39.905774Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:06181a53a780f655035268a317f5e1c533e3c62b1491ef8df2784c002afcb799","observation_id":"20453d1d-5921-43a2-8ac6-dbd35725fa69","resolution":{"observed_at":"2026-07-01T07:05:29.162859Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:43be915e4a1e4a1d748b64d530a16c883f15e397f1ff78da22d1d515253e6c5d","observation_id":"43dfb4ac-d655-4536-92da-3ed0321accc6","resolution":{"observed_at":"2026-07-04T16:49:57.654524Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:1f35bfa0dc719948f6018344bf1965cb9fcdde3cf02574bfe50eb2f575cede18","observation_id":"9beee4c7-9877-4738-9d74-9ecb7464a9b0","resolution":{"observed_at":"2026-07-04T13:09:50.984847Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:7076676cf591a0fb0df3f87052e1ccec67b52c21aca050244e1697347e07851e","observation_id":"7c501338-3a02-431f-9558-da41b865ca4f","resolution":{"observed_at":"2026-06-30T09:44:37.396418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-01T03:52:55.381722Z","title":"arXiv preprint arXiv:2506.03099 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-06T04:02:53.538330Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.381722Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:ffbc63f799bb0dcb868a1c034380cb0c23a013460003e392a959eba837ce53b0","observation_id":"7f04e79c-db6c-4a78-a9e3-beeb532e6853","resolution":{"observed_at":"2026-08-01T03:52:55.381722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-06T00:31:25.351877Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models.arXiv preprint arXiv:2506.03099, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01157","last_updated":"2026-08-02T11:28:13Z","snapshot_observed_at":"2026-08-08T03:59:35.155645Z","submitted_at":"2026-08-02T11:28:13Z","title":"InteracVid: Building a Real Interactive Audio-Visual Response Dataset from Live-Chat Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:25.351877Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2608.01157"},"observation_digest":"sha256:d2bd1cfe15e5ebb352fd012ed74f367e8be50d2e3a868ef9589101de9aef5ef0","observation_id":"0c8ab426-3d39-468f-8d82-a2b5be377eeb","resolution":{"observed_at":"2026-08-06T00:31:25.351877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03099/citation-record","integrity":"/paper/2506.03099/integrity","json":"/paper/2506.03099/citation-record.json","paper":"/paper/2506.03099"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:55.247754Z","title":"Paddleocr, awesome multilingual ocr toolkits based on paddlepaddle","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.247754Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:e02beb028b783c4e24e0216a9ec753386a73ae801a7c4b5faf4e9f2810640319","observation_id":"be2a126a-4132-448e-a691-6638350343c6","resolution":{"observed_at":"2026-08-07T11:13:55.247754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:01.886024Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"4a94801a-b7fa-4ecd-bf0c-555a4bdcc48d","year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.363593Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:c48030aac6c11722c23ef71a43a55331de028ccc2d0a91aab66cb5dc90d2764d","observation_id":"0f2650c3-b200-4c0a-9c7d-954cb1055510","resolution":{"observed_at":"2026-08-07T11:14:01.986958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:01.567651Z","title":"Pyscenedetect: Python and opencv-based scene cut/transition detection program & library","venue":null,"work_id":"83559423-fc76-4eae-8a80-ec6d28013c2c","year":null},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.459398Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:b48a6efe038ec33734ca4bd31452259542a14d5fecb682ea675efb07566208c5","observation_id":"2ebadf33-3ada-42e2-b5d9-3759e9261aa0","resolution":{"observed_at":"2026-08-07T11:14:01.736592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:55.541205Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.541205Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:f328f96b8b0e44442c0624426f84ba398653589eb148984c7a0e165fa851ba0b","observation_id":"b7d2e49b-57fc-45f2-969d-6c9133ef8812","resolution":{"observed_at":"2026-08-07T11:13:55.541205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:01.217270Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":"a611c7c7-91a4-4ce8-b07d-fee280971bd4","year":2016},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.615493Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:f1d3caa412afb6ecb4cc6514ebf0978f167c45070665bfdda37bb13fefc50544","observation_id":"44305ca2-d0ae-454e-9325-cdafbc7213f1","resolution":{"observed_at":"2026-08-07T11:14:01.392067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T11:13:55.731959Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.731959Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:87ccba08ee524a474e12e65cbafe2edb5889ddddc81ddaa1c3a56de12b2f97d9","observation_id":"788de9a0-d16f-45c6-8538-c159f581c7c2","resolution":{"observed_at":"2026-08-07T11:13:55.731959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:55.862202Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.862202Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:ab746e1deab8bdb7c497d2e45119a4246e1656041a81386ccf04961335c18336","observation_id":"daa3d8d8-b633-412b-a673-4d584f534ed0","resolution":{"observed_at":"2026-08-07T11:13:55.862202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:00.933016Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"b19618b7-84dc-42d1-ba34-ddccedd3a1b6","year":2022},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:55.961042Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:d639551a49e330773c3a5afa415829b6eb10447426e3d850d66007382602e0cf","observation_id":"26dbfc62-4f82-40aa-8f92-a91c286423cc","resolution":{"observed_at":"2026-08-07T11:14:01.052274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:00.649675Z","title":"Megaportraits: One-shot megapixel neural head avatars, 2023","venue":null,"work_id":"9244df93-3b09-41d6-b530-2add42998773","year":2023},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.077398Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:fbb9583ef71b70daecfa8e861df0b03515d243e2d2d7ee22fb585fc12bddce3a","observation_id":"ee1ae07c-8a14-4eae-a7c3-456db9e08f60","resolution":{"observed_at":"2026-08-07T11:14:00.775196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14851","last_updated":"2024-07-11T03:14:54Z","snapshot_observed_at":"2026-07-06T17:34:11.950339Z","submitted_at":"2024-02-20T03:57:55Z","title":"$R^3$: \"This is My SQL, Are You With Me?\" A Consensus-Based Multi-Agent System for Text-to-SQL Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14851","snapshot_observed_at":"2026-08-07T11:13:56.220334Z","title":"Rectified flow matching: Towards fast and stable training of continuous normalizing flows","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.220334Z"},"links":{"cited_paper":"/paper/2402.14851","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:125a20e1eb59aa7df2911a89c2a93991606e46859cb471c0392334414618a47b","observation_id":"b0ed24da-a047-4360-8a37-57dee11d2c5d","resolution":{"observed_at":"2026-08-07T11:13:56.220334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-07-06T13:15:58.303738Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-07T11:13:56.315933Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.315933Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:0f5dfb84079cfe4300f722552a837f40db69434560b8e23c060fc8098ae8666e","observation_id":"a333e764-c15a-48ab-9d4c-c2793ff3c004","resolution":{"observed_at":"2026-08-07T11:13:56.315933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14509","snapshot_observed_at":"2026-08-07T11:13:56.372275Z","title":"Deepspeed ulysses: System optimizations for enabling training of extreme long sequence transformer models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.372275Z"},"links":{"cited_paper":"/paper/2309.14509","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:2aa2bb67ffaf67e31e0de08dea972c7a531fba57eb1b385439d3d8026cbd978e","observation_id":"3617d214-d00d-4a79-991e-e21383fe4cdb","resolution":{"observed_at":"2026-08-07T11:13:56.372275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:00.357427Z","title":"An introduction to variational autoencoders","venue":null,"work_id":"0d28933e-ec8e-4a19-bcee-191c21583983","year":2019},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.439850Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:fb2f0a56f439b29ec3e8327092474e023f6335eef2ea81b6930fa9e1e95ebbff","observation_id":"e577f335-9c5d-4610-a9bd-fbc087ae0c2d","resolution":{"observed_at":"2026-08-07T11:14:00.516620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T11:13:56.524029Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.524029Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:9f44385d533ade0990a13a1badff51d3661d55d0c5258932ffdcc116f20948f9","observation_id":"9935acfc-626f-48b4-9bdb-8e0340511a27","resolution":{"observed_at":"2026-08-07T11:13:56.524029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:14:00.045798Z","title":"Livekit: Open-source webrtc infrastructure for real-time audio and video, 2025","venue":null,"work_id":"5569ccc4-f7da-4778-ba2c-1a82687c22da","year":2025},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.608705Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:d61435981c64ee99531ebcf15c882870c5b896dacf12f9301d83db5b5c6f0c35","observation_id":"107e56ae-08ef-443f-8670-4dba779c53d8","resolution":{"observed_at":"2026-08-07T11:14:00.185410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:59.805877Z","title":"Scalable parallel programming with cuda: Is cuda the parallel programming model that application developers have been waiting for? Queue, 6(2):40–53, 2008","venue":null,"work_id":"82fbfaf9-3568-45ee-99a1-de1851ffcf46","year":2008},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.709513Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:6a443192f55e8d5fe3170688e851a5cccc4a19693b32ad68f09fe3c7293329a7","observation_id":"1cae25c6-955c-4203-9488-c8445c07b4db","resolution":{"observed_at":"2026-08-07T11:13:59.908784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:56.813355Z","title":"Zero: Memory optimiza- tions toward training trillion parameter models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.813355Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:6834452c0590dfb6802a3c8ebe3fafb9159afa99f9ae5ff2974bfead49cc34ff","observation_id":"5236f2fc-6bd4-4bbe-b170-0bc0b21ebc4f","resolution":{"observed_at":"2026-08-07T11:13:56.813355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:56.919267Z","title":"High-resolution image synthesis with latent diffusion models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:56.919267Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:5323dc31c0f62d1355aae4700f7f78a64e61cef7ae84514549b1697ceff2d43f","observation_id":"bfbccb1d-a200-4167-a993-4932198e9b82","resolution":{"observed_at":"2026-08-07T11:13:56.919267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:59.544617Z","title":"Laion-aesthetics: Predicting the aesthetic quality of images, 2022","venue":null,"work_id":"551cf0e3-f31f-4c72-b70f-0ffc5dfacd60","year":2022},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.036868Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:48b285988d7fad63e13b0ac1718842ef2d7e6679145434c0eea8e56df61c43d2","observation_id":"4339643c-837b-4050-ba16-5cbde8336b16","resolution":{"observed_at":"2026-08-07T11:13:59.631482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:57.139344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.139344Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:ee33be23a97063b11b625d212b01011813ad282affe99c32bd06ad38444d897c","observation_id":"2c48512b-077c-4442-8d15-12d8e7565650","resolution":{"observed_at":"2026-08-07T11:13:57.139344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:57.276095Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.276095Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:4dc6a2f2e7b2baa30ef9f50ae05a539d5999dbd7d0359a10030fcb058577c012","observation_id":"b92c60cb-edd0-47e8-b484-7aebe67e433f","resolution":{"observed_at":"2026-08-07T11:13:57.276095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:57.339398Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.339398Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:bf964941c2c75636c42ab5f527d0aa61212707c630bd1e00ae5c95de1dc679e7","observation_id":"82a768ea-2ffd-4e46-9cf5-e023d00b4bcc","resolution":{"observed_at":"2026-08-07T11:13:57.339398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-07T11:13:57.442069Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.442069Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:940f98292acb89d71f1ef8ae50dfad99e54a25aca67f1e6329a21aab377b141b","observation_id":"a054e9ea-4728-44a9-b187-273d4de7624a","resolution":{"observed_at":"2026-08-07T11:13:57.442069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:57.556565Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.556565Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:e17cdcacb8d10eff5b673e51285f0941d24a5c252a1eaf49afacc4b5af442a9d","observation_id":"741262d4-f416-4402-b419-9441062c00fe","resolution":{"observed_at":"2026-08-07T11:13:57.556565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T11:13:57.658994Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.658994Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:5d058a9a2b6d6e8e9e8dc4674f88df1f4b9967a21e96e6da1ce2c6ab9757ea1b","observation_id":"d6f1d52f-ba1e-485d-adcc-71b92e63aacd","resolution":{"observed_at":"2026-08-07T11:13:57.658994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:59.185453Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time, 2024","venue":null,"work_id":"7590954a-3e5f-47ff-bf7b-757bb6a552ea","year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.765627Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:c1ebb5a98acb76b98976c0fdef533880dc209959e28628ca717270943a8c7715","observation_id":"efd8088e-857c-4e2b-a946-8d573e7cf149","resolution":{"observed_at":"2026-08-07T11:13:59.367704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-07T17:20:57.588862Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T11:13:57.860540Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.860540Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:856ebeb42e1b6554e6a69f192be320c84ecdcfc0cbcbedd440abed0b45e89a6d","observation_id":"58efbcb1-e9d4-47f8-ad9f-71c77983bf46","resolution":{"observed_at":"2026-08-07T11:13:57.860540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:58.946145Z","title":"Improved distribution matching distillation for fast image synthesis","venue":null,"work_id":"afa391b8-f6e2-4709-bbf1-02bf3ad0d4d8","year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:57.946790Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:41aee73a3e8873f93618ccce6c9228e280d1f3e111acefc7e0f30a8fbf9be545","observation_id":"67181f11-e43f-412b-b4fd-350470c0bc1e","resolution":{"observed_at":"2026-08-07T11:13:59.079749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:58.034163Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:58.034163Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:e2ef8aeb16eb248bc5b7724ed0a3e05b2f6ea6596d41bae759330639cec185fd","observation_id":"72504a90-1dbd-436a-9501-d36414f2d534","resolution":{"observed_at":"2026-08-07T11:13:58.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:58.127451Z","title":"From slow bidirectional to fast causal video generators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:58.127451Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:820596eb08d454cbc4b767a102eca07faddbcdb95704553162a4ba115fd4207a","observation_id":"464facd5-8605-4f95-bc3b-2eabcd8ff008","resolution":{"observed_at":"2026-08-07T11:13:58.127451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:13:58.587853Z","title":"Pytorch fsdp: Experiences on scaling fully sharded data parallel, 2023","venue":null,"work_id":"b245874a-3741-408e-97c2-b4e58174b3f2","year":2023},"citing_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:13:58.243293Z"},"links":{"citing_paper":"/paper/2506.03099"},"observation_digest":"sha256:05c5f9590a0fe328917871697fba91ebfafb7ff13090a4b91c67ff481f1ac0a6","observation_id":"ff555d9c-c9fe-401f-8fd9-96615bb22c2d","resolution":{"observed_at":"2026-08-07T11:13:58.703078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 19 inbound Pith citation observations for arXiv:2506.03099."}