{"as_of":"2026-08-10T00:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d9554a6d16b3caa497653ba9765cc7d158ab840e1efe9d111dd64f934f4f9d1","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:30:41.029982Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2512.13247/citation-record","integrity":"/paper/2512.13247/integrity","json":"/paper/2512.13247/citation-record.json","paper":"/paper/2512.13247"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:31.570218Z","title":"Deep audio-visual speech recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(12):8717–8727, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:31.570218Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:cc3e35cdf4717124f68da0b50516eb7d377850ec41e83d1cace0308a63c7c0ac","observation_id":"242fbb76-35db-4825-a0dc-9859150589a7","resolution":{"observed_at":"2026-08-03T16:30:31.570218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-03T16:30:31.687428Z","title":"Lrs3-ted: a large-scale dataset for visual speech recog- nition.arXiv preprint arXiv:1809.00496, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:31.687428Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:7f88340e5dbaa6626de0d1646111345aac8a402ba8af0ad3c499a678b7ca5424","observation_id":"6928ce21-def6-4d5e-8639-962e91a697bd","resolution":{"observed_at":"2026-08-03T16:30:31.687428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:31.788229Z","title":"Rignerf: Fully controllable neu- ral 3d portraits","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:31.788229Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:053b3c7aab8ca01d97bbbba33d01697d8a9a31444cd1c5b82ec12c981e4e9d06","observation_id":"191b26e3-a26e-4af3-ba90-f0aa1d6265b1","resolution":{"observed_at":"2026-08-03T16:30:31.788229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:31.865125Z","title":"Id-to-3d: Expressive id-guided 3d heads via score distillation sampling.Advances in Neural Informa- tion Processing Systems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:31.865125Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:9f840a1cb46b2b11d1d77bd9ae360df3e6f616b4e26c6995823accb66a5bbeff","observation_id":"46ffd0bc-69db-4bf5-b3c8-5fa83c3a83cc","resolution":{"observed_at":"2026-08-03T16:30:31.865125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:31.955776Z","title":"Wav2vec 2.0: A framework for self- supervised learning of speech representations.Advances in neural information processing systems, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:31.955776Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:279ad2599908c4e3994d6078b9044ce2b2d8321c50bed8d789f2e0023cca3b29","observation_id":"39edeeb2-bef9-4b81-8b09-7c4309d37a5b","resolution":{"observed_at":"2026-08-03T16:30:31.955776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-03T16:30:32.166173Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.166173Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:df977731c8681fe28b064ed2848a15395563e7596952adedc7c5a467e11e139c","observation_id":"752870c4-ffaa-47fb-a774-6fa0fa686ce2","resolution":{"observed_at":"2026-08-03T16:30:32.166173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.343965Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.343965Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:551bf14be40be3751539765f2d3f1747a3f35cc09cd95265bb84236fc0215a8a","observation_id":"1041f84d-e043-4222-978d-906f7abfede2","resolution":{"observed_at":"2026-08-03T16:30:32.343965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.434438Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.434438Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:e3e87201cfb82751d48667d6836a4e0d8e66930f0c46fdd2068a0ac2158ab935","observation_id":"11e0462b-0318-4663-b54e-ef55b3a2de65","resolution":{"observed_at":"2026-08-03T16:30:32.434438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.553306Z","title":"X-dyna: Ex- pressive dynamic human image animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.553306Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ebcc6e34985c2aae2b68a15ffff44bd9e6e45dc1d09108911b26c209e22e882b","observation_id":"65dafdc2-20ea-4a98-a534-ca4d4625b2a1","resolution":{"observed_at":"2026-08-03T16:30:32.553306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.624883Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.624883Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a0ca77ee2cad518c875a58c63b9a627eace31f4d084e1e18a2f7e2ba09b2497d","observation_id":"3e328c9b-3b15-426b-bcdd-98d5185051b3","resolution":{"observed_at":"2026-08-03T16:30:32.624883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-03T16:30:32.718987Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.718987Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4002253fd0fe5d4d7931c10a84e8970376dc5aef36d977ddb2e4caeddb92e2dd","observation_id":"0b127765-b937-43a6-9ef4-c84c1a3a5510","resolution":{"observed_at":"2026-08-03T16:30:32.718987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.803336Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.803336Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:d1f54b300c5ca2d24fe1740782c184657a05d1a59e9be5e44ee4ec2b3b10d661","observation_id":"4235c6d0-9187-438b-837a-31dde6e7e43d","resolution":{"observed_at":"2026-08-03T16:30:32.803336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:32.886547Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:32.886547Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ac907b510854406e2654f6c202dc15fdfc77b2cd2df5c252a1bd1a7621749be1","observation_id":"4636df29-4c2d-403f-8874-67529b654656","resolution":{"observed_at":"2026-08-03T16:30:32.886547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.061276Z","title":"Portrait4d-v2: Pseudo multi-view data creates better 4d head synthesizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.061276Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:9aa6a6b355b8eb338a67ec225afcd8c65a1a55b6623876f93e27836eab87de13","observation_id":"ddeb31f7-6397-419e-8b5c-6bbbea3d046f","resolution":{"observed_at":"2026-08-03T16:30:33.061276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.162001Z","title":"Black, and Timo Bolkart","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.162001Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a425acb38e980402ab201b4999d610408063f0db0c43d994f155231333c95a51","observation_id":"8f4a3a6d-0f4e-4226-9a44-4141583dce20","resolution":{"observed_at":"2026-08-03T16:30:33.162001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11094","last_updated":"2022-07-22T14:07:46Z","snapshot_observed_at":"2026-08-06T05:31:42.749956Z","submitted_at":"2022-07-22T14:07:46Z","title":"Visual Speech-Aware Perceptual 3D Facial Expression Reconstruction from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11094","snapshot_observed_at":"2026-08-03T16:30:33.250107Z","title":"Visual speech-aware perceptual 3d fa- cial expression reconstruction from videos.arXiv preprint arXiv:2207.11094, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.250107Z"},"links":{"cited_paper":"/paper/2207.11094","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:b730fb05ee10077cd74705312a537ead57930accc57b0ae7a2b820f4a393e218","observation_id":"fbb8817e-46d6-43cb-b651-a0698d69fe13","resolution":{"observed_at":"2026-08-03T16:30:33.250107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.301402Z","title":"Dynamic neural radiance fields for monocular 4d facial avatar reconstruction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.301402Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:6284c30aefcd9326534e04f39f99d8a308ac56053a9a1149b11d051f2681ba0b","observation_id":"826a90c1-2e46-49be-99d4-72bbfc6f7d5f","resolution":{"observed_at":"2026-08-03T16:30:33.301402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.348874Z","title":"Srinivasan, Jonathan T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.348874Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:6bffae3a845e09f2c1ec3d6afd2cddd7f37ea15708878519cfae11355dc9b6da","observation_id":"02398a05-1abe-420e-91c3-3d2b09f2683c","resolution":{"observed_at":"2026-08-03T16:30:33.348874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.487172Z","title":"Animateme: 4d facial expressions via diffusion 9 models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.487172Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:999a2e0eb6dc4ac284e013eef62d847b91164d970bf5e4dcfece9079013cc293","observation_id":"e70596fc-8f93-476d-b22e-cf3df04675fc","resolution":{"observed_at":"2026-08-03T16:30:33.487172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.571623Z","title":"Arc2avatar: Generating expressive 3d avatars from a single image via id guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.571623Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:06b97403d4203102a8a690cb187a3697015607a1b9ea3412e02412865b3c8bad","observation_id":"c759ee61-b77b-4c89-8983-4766e67a9909","resolution":{"observed_at":"2026-08-03T16:30:33.571623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.638606Z","title":"Generative adversarial nets.Advances in neural information processing systems, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.638606Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:07ab51bc73320fb27770c270755edfd3d4d7790f3fb1cf01e1ca88c0b4913384","observation_id":"cd2a97ec-3f29-4ef2-8fb6-7ed8878a06f0","resolution":{"observed_at":"2026-08-03T16:30:33.638606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.727435Z","title":"Neural head avatars from monocular rgb videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.727435Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ec8ab740143964b29410b3b42f04325db81b79e1c2d3426dd21c617f0d358308","observation_id":"94908cdd-1d12-4155-8dd2-9d204ff97007","resolution":{"observed_at":"2026-08-03T16:30:33.727435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16933","last_updated":"2023-11-28T16:33:08Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T16:33:08Z","title":"SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16933","snapshot_observed_at":"2026-08-03T16:30:33.805660Z","title":"Sparsectrl: Adding sparse con- trols to text-to-video diffusion models.arXiv preprint arXiv:2311.16933, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.805660Z"},"links":{"cited_paper":"/paper/2311.16933","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4d89d2623a32a435100fd17465a111b35407061723ea81725a2ce7065fa13b0c","observation_id":"eca14e2b-53eb-46c0-9574-a87f43f2cd10","resolution":{"observed_at":"2026-08-03T16:30:33.805660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.921329Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning.Interna- tional Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.921329Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:c871b6ce63bdf63f8c9ea97e0b3a1d9efdc100cf08a25acfefd83bb1df2827d7","observation_id":"b76ae828-863c-45a7-affd-335edc4d1fb8","resolution":{"observed_at":"2026-08-03T16:30:33.921329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:33.999403Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium.Advances in neural information processing systems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:33.999403Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:b25d3fe82eb7298d59504f2dde27f4a9f44417ca84f532105ba04a86ef316462","observation_id":"ca5da7bf-262e-4e4e-8475-68cc9a4d705c","resolution":{"observed_at":"2026-08-03T16:30:33.999403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:34.122254Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.122254Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:7cebef5e2a4fe31afe858a0d9b652e1884e62c7760a619521dfe32beef3ff6c8","observation_id":"81bd2dfa-07bb-465d-bcab-de3bd1cf0323","resolution":{"observed_at":"2026-08-03T16:30:34.122254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-03T16:30:34.235121Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.235121Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a61c7f8025a99d1c94a594744a8a99fe8eef8a332eaa5eb28669cbf4244c7d86","observation_id":"394311bd-d768-4349-899e-cbff3bb9d025","resolution":{"observed_at":"2026-08-03T16:30:34.235121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-03T16:30:34.344003Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation.arXiv preprint arXiv:2311.17117, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.344003Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:922aa7c17719dc34a32dc6f3663c99acedea011760a071ba57f66f6f40ec8f92","observation_id":"3a9d8aa3-a42e-4106-8eb1-3ad214e61c56","resolution":{"observed_at":"2026-08-03T16:30:34.344003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-03T16:30:34.497342Z","title":"Self forcing: Bridging the train- test gap in autoregressive video diffusion.arXiv preprint arXiv:2506.08009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.497342Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ba6857c51228f09112d53ff9a92d0115ceb84d7f3725695ebd136ecd06b5a45c","observation_id":"3defc845-6b14-46a8-af97-b4b7b2ac0b2a","resolution":{"observed_at":"2026-08-03T16:30:34.497342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-03T16:30:34.578349Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.578349Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:e42753d351135068a5787a603bd0ac1576363f4399cd05c8b5c0ea28cdabfbab","observation_id":"f7011014-8836-48d4-92f4-1778890ff7a3","resolution":{"observed_at":"2026-08-03T16:30:34.578349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:34.698328Z","title":"A style-based generator architecture for generative adversarial networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.698328Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:77174883222ea07243b4834882ccf599d1771b708abbaa8ec599f409297d2634","observation_id":"fbe1d7fb-4050-4695-bb60-0affa5994581","resolution":{"observed_at":"2026-08-03T16:30:34.698328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:34.809760Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.809760Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:203f67af270e905263b8072ec0c4000bcf691a589da59438e19ce0b2f4010c3f","observation_id":"f1eebd37-7836-4255-8be3-3a7ba2365f89","resolution":{"observed_at":"2026-08-03T16:30:34.809760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:34.901469Z","title":"Float: Generative motion latent flow matching for audio-driven talking portrait","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:34.901469Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:2e9f7f0524e032c3df08687b1fcb882c4a01a8aac635ddb3c1fae7fdca94d854","observation_id":"e63a812e-cf2c-4259-a52a-25acf86467c8","resolution":{"observed_at":"2026-08-03T16:30:34.901469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.001074Z","title":"Nersemble: Multi-view ra- diance field reconstruction of human heads.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.001074Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:83e2f30df2f01178febac1bd5e11bcef30113a09d1fed05e12fb0af95583f7dc","observation_id":"fbddb0f7-2a93-4c00-bee6-6f560aa15975","resolution":{"observed_at":"2026-08-03T16:30:35.001074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T16:30:35.074851Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.074851Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:7a791dde00744a04aeebbae1850d59d8d498d73955becb42e3be6a828a1dcef1","observation_id":"808651a2-bde0-4c82-9029-654d3ead2f1b","resolution":{"observed_at":"2026-08-03T16:30:35.074851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.215180Z","title":"Spherehead: stable 3d full-head synthesis with spherical tri-plane representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.215180Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:aa999dfb3188c5279170cab3b56ffc6486b383ba5c76c6f534845599b025b99d","observation_id":"acbb6633-f732-42e2-87ef-e714ecfe718f","resolution":{"observed_at":"2026-08-03T16:30:35.215180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.272753Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.272753Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:de4b6869ff3b6f01eeaa70e9afc1a01cacdffebb056a46825cda3698a84a1353","observation_id":"0c3c7130-21ce-4f89-a332-050bb1e35d38","resolution":{"observed_at":"2026-08-03T16:30:35.272753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.397161Z","title":"One-shot high-fidelity talking- head synthesis with deformable neural radiance field","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.397161Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:b4db1d776f28181bcc32b5ac4a68650ae825ba56157c34994f5b22c1a19d9dd6","observation_id":"219c7d78-1777-488f-806a-e336e39069bc","resolution":{"observed_at":"2026-08-03T16:30:35.397161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.485676Z","title":"Generalizable one-shot 3d neural head avatar.Advances in Neural Information Processing Systems,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.485676Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ba8b258ff8a49b4742d7d8cd9090bf3d18fe44c5a500293944a547659097cb79","observation_id":"b1df8b29-848c-4997-886e-0825dd37a5e7","resolution":{"observed_at":"2026-08-03T16:30:35.485676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.713904Z","title":"Im-portrait: Learning 3d-aware video diffusion for photorealistic talking heads from monoc- ular videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.713904Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:76ec416ed5dabcf6a571074a7aa5cb8b60df1e24fc7737cee12cc4135c737878","observation_id":"de78be16-963a-4df0-a1bb-134c7e7f8e1f","resolution":{"observed_at":"2026-08-03T16:30:35.713904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.858555Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.858555Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:7f17ad1087f6dd375ead8b65cff68abf5eb60131ee4902fc0165714662abe6d5","observation_id":"95bb7677-80ca-4422-8d42-5443a6169694","resolution":{"observed_at":"2026-08-03T16:30:35.858555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:35.996816Z","title":"Anitalker: animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:35.996816Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:30d489c75e4e0d6cf9d02951c8cc5b87cabb59629322fcd554c0a4ccc7004f71","observation_id":"106a0397-d1e4-489f-99c1-90de931acb3f","resolution":{"observed_at":"2026-08-03T16:30:35.996816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T16:30:36.083220Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.083220Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:bd11a54eec82a7f2b976c698fdd5769b1365680a2ccaf15d48bfd839593024b9","observation_id":"7928c3f5-233c-4514-9e8a-d159f6038bfe","resolution":{"observed_at":"2026-08-03T16:30:36.083220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:36.291689Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps.Advances in Neural Information Processing Systems, 35:5775–5787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.291689Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:92718ae5b4eaa9edca76baf1d89bedf8dcb17e7797166d81c9da61cd935a7bc1","observation_id":"2551374a-9f34-420f-bd87-8dfba11de37c","resolution":{"observed_at":"2026-08-03T16:30:36.291689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-03T16:30:36.393186Z","title":"Dpm-solver++: Fast solver for guided sampling of diffusion probabilistic models.arXiv preprint arXiv:2211.01095, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.393186Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:8734de5592ce186a7183470845bb46a672ce13f7e13d1842af506c5e679c8165","observation_id":"4409eef2-a474-42c9-ae30-2d1397b1cfbb","resolution":{"observed_at":"2026-08-03T16:30:36.393186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:36.532426Z","title":"Visual Speech Recognition for Multiple Languages in the Wild.Na- ture Machine Intelligence, 4:930–939, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.532426Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4a41403fd4426a57c75d3c6f21f079bad847f052de2bc1040befb78c8abdb27f","observation_id":"d06f37eb-e0b2-44da-9ec9-c547503dee50","resolution":{"observed_at":"2026-08-03T16:30:36.532426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01186","last_updated":"2024-01-03T09:10:12Z","snapshot_observed_at":"2026-07-06T15:11:35.938311Z","submitted_at":"2023-04-03T17:55:14Z","title":"Follow Your Pose: Pose-Guided Text-to-Video Generation using Pose-Free Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.01186","snapshot_observed_at":"2026-08-03T16:30:36.601149Z","title":"Follow your pose: Pose-guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.601149Z"},"links":{"cited_paper":"/paper/2304.01186","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:84e7b5f452e1770f2811e8aeedd21fd5aad888a4e052431f3ba976df67d840e0","observation_id":"6742e00e-5f10-43fe-b9e8-9e6f3c674845","resolution":{"observed_at":"2026-08-03T16:30:36.601149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:36.700349Z","title":"Otavatar: One-shot talking face avatar with control- lable tri-plane rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.700349Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:9a14698ecc5999c3589803cbebce5e8c65e4bdbb91789b772a1e9986e48ae702","observation_id":"84c2ebfe-5a4c-4cd6-888a-ec9a7696e51e","resolution":{"observed_at":"2026-08-03T16:30:36.700349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:36.819914Z","title":"Isambard-ai: a leadership-class supercomputer opti- mised specifically for artificial intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.819914Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:5277fc224a0d7ff35f955548b46b1c47e271ddd5a6843f0e83469204dee4ddfe","observation_id":"875c9368-921a-4d6b-ba46-5987c70a55d1","resolution":{"observed_at":"2026-08-03T16:30:36.819914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:36.924756Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis.Communications of the ACM, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:36.924756Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4f0feadd220de88871028e140b266d13355e41484d8481b5d9b219d732eeb344","observation_id":"6b360ebc-d83e-4f0f-93b9-4653f93eb4a9","resolution":{"observed_at":"2026-08-03T16:30:36.924756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15321","last_updated":"2024-04-10T18:13:00Z","snapshot_observed_at":"2026-07-06T16:11:47.380913Z","submitted_at":"2023-08-29T14:16:09Z","title":"Elucidating the Exposure Bias in Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15321","snapshot_observed_at":"2026-08-03T16:30:37.031365Z","title":"Elucidating the exposure bias in diffusion models.arXiv preprint arXiv:2308.15321, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.031365Z"},"links":{"cited_paper":"/paper/2308.15321","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:30521536eb9533ffc5c6ba745122afbcc9a8c458e9eefc51f2dd4d73aa252bc9","observation_id":"37fb9548-2a67-43a1-9c86-92146d94137b","resolution":{"observed_at":"2026-08-03T16:30:37.031365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:37.182264Z","title":"Arc2face: A foundation model for id-consistent human faces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.182264Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:00c1aeb94ef1a568bb2975bb8faa10e158782eb4ae685c4e179eb5d64a698b50","observation_id":"e2a1faac-0c16-4d4c-ac14-03e3f58ea969","resolution":{"observed_at":"2026-08-03T16:30:37.182264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:37.271905Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.271905Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:f902d0bdfb0091364c00367dbdca2bfd34a11e61f812085eba58d1b0b3df2e2b","observation_id":"99561777-a0c5-4a4c-9079-480bb99f893c","resolution":{"observed_at":"2026-08-03T16:30:37.271905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-03T16:30:37.377778Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.377778Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:028910ce9f3c27f2f9b0f22471eb43895f4b6d8b6d95aae2a2a4d50b3ade8c9c","observation_id":"25ac8a62-8686-42e7-943f-88d069e31bff","resolution":{"observed_at":"2026-08-03T16:30:37.377778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:37.557723Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.557723Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a935caad4e3d808dfcbeb9e2097ebbbc9270663ab9b22d6b705f183506681900","observation_id":"3ad7472c-0c50-4815-b330-02b91167216f","resolution":{"observed_at":"2026-08-03T16:30:37.557723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:37.628661Z","title":"Gaus- sianavatars: Photorealistic head avatars with rigged 3d gaus- sians","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.628661Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:ae44737aa6fdad26f008a6fbe57afc5e615c5abf837d9371deff34e22ec2f88a","observation_id":"f1139cd7-bb04-4461-98f0-8dc917732474","resolution":{"observed_at":"2026-08-03T16:30:37.628661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00292","last_updated":"2019-11-07T06:55:36Z","snapshot_observed_at":"2026-08-06T13:05:16.615295Z","submitted_at":"2019-10-01T10:28:32Z","title":"Generalization in Generation: A closer look at Exposure Bias","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00292","snapshot_observed_at":"2026-08-03T16:30:37.723334Z","title":"Generalization in generation: A closer look at exposure bias.arXiv preprint arXiv:1910.00292, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.723334Z"},"links":{"cited_paper":"/paper/1910.00292","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:dbbe76f2964b3ced072da2633989f6f57f1bfc2fcb8dc8ea70a2135f721bb9bb","observation_id":"9ea2e7f3-6988-4242-861f-416d7ffb215b","resolution":{"observed_at":"2026-08-03T16:30:37.723334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-03T16:30:37.850388Z","title":"Wav2vec: Unsupervised pre-training for speech recognition.arXiv preprint arXiv:1904.05862, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.850388Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:8a42bae6194c77dc878e1325774de42e68a44c2c379a533bf7612d0ea44bc2ae","observation_id":"8696e58f-7177-4cd2-8f24-63c0c5ab6eed","resolution":{"observed_at":"2026-08-03T16:30:37.850388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:37.996463Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:37.996463Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:f7f513344b07802ce3dd76ceb644a45330fd5c4b2f0a277f441a6aa4f9eb7354","observation_id":"94b10062-5343-4d70-af25-a483816c7257","resolution":{"observed_at":"2026-08-03T16:30:37.996463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15110","last_updated":"2023-10-23T17:18:59Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:18:59Z","title":"Zero123++: a Single Image to Consistent Multi-view Diffusion Base Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15110","snapshot_observed_at":"2026-08-03T16:30:38.106522Z","title":"Zero123++: a single image to consistent multi-view dif- fusion base model.arXiv preprint arXiv:2310.15110, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.106522Z"},"links":{"cited_paper":"/paper/2310.15110","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:b65263bda2a977f322880f29ab9fd4e6802cab54806ac53e221eda7b34d74bcf","observation_id":"afb30cb3-8e71-4d4d-a5c9-fd3ee329c9aa","resolution":{"observed_at":"2026-08-03T16:30:38.106522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-03T16:30:38.220611Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.220611Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:81549cbb3630b8d6c6ac9bf5836df41d941d6a31dbdbff0bb87f8268d943a140","observation_id":"7d76e169-e41f-4b66-8a70-5183dbb912f4","resolution":{"observed_at":"2026-08-03T16:30:38.220611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:38.374267Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.374267Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:0c422c8a737fc3dd6776436811b33f9fa3157247758df00766127f1949dee51f","observation_id":"403fa4b0-489d-48a1-9b2f-ddc09129078c","resolution":{"observed_at":"2026-08-03T16:30:38.374267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:38.549141Z","title":"Emo: Emote portrait alive - generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.549141Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:f2abf45040f0e21982de45b89e03a9a308ce8665d1985af172268a66db8d45df","observation_id":"2182c974-2c76-440d-b922-171e293a5fce","resolution":{"observed_at":"2026-08-03T16:30:38.549141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-03T16:30:38.620629Z","title":"To- wards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.620629Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:16dde52c3f4175635eb333270917cf47acc0420f7be68612faba0d295a82aceb","observation_id":"86fa87d0-f67a-42b4-974a-3c28957a479a","resolution":{"observed_at":"2026-08-03T16:30:38.620629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T16:30:38.778119Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.778119Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a5378eaf82a7b2a1cb0995c993057ea152804024f886bb91c59f75baf8b57e3e","observation_id":"25212b15-ad3b-4487-90a2-96751809c19c","resolution":{"observed_at":"2026-08-03T16:30:38.778119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-03T16:30:38.891584Z","title":"V-express: Conditional dropout for progres- sive training of portrait video generation.arXiv preprint arXiv:2406.02511, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:38.891584Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:62ed6adc5419bcc13a00cf62080801d415f5944b4aa2f786caed9c5d774491fd","observation_id":"61b7f1b7-40a3-48d5-9cff-3319c4fa43aa","resolution":{"observed_at":"2026-08-03T16:30:38.891584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.00040","last_updated":"2024-04-04T19:41:09Z","snapshot_observed_at":"2026-07-06T15:48:59.545602Z","submitted_at":"2023-06-30T17:37:48Z","title":"DisCo: Disentangled Control for Realistic Human Dance Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.00040","snapshot_observed_at":"2026-08-03T16:30:39.076074Z","title":"Disco: Disentangled control for referring human dance generation in real world.arXiv preprint arXiv:2307.00040, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.076074Z"},"links":{"cited_paper":"/paper/2307.00040","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:be5607d3a6c03d2262a1ba946eb557b772072e3d7736a3e2753acc52f61439b8","observation_id":"0a529e18-e194-4a28-a382-592abd4bf2f1","resolution":{"observed_at":"2026-08-03T16:30:39.076074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.171775Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.171775Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:1117911cb3c789caaa2a0923b5d07ab8d4eebbc01d7b171d151ddbc751d8337e","observation_id":"46b4810d-e767-432a-b36c-1fd296247647","resolution":{"observed_at":"2026-08-03T16:30:39.171775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.261453Z","title":"Videocomposer: Compositional video synthesis 11 with motion controllability.Advances in Neural Information Processing Systems, 36:7594–7611, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.261453Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:aee4a0f7247214abd228cd326fc05f90b24e50c8735f8a44d7f3cc93bad08547","observation_id":"8c32dc19-7b63-4871-be44-8fe6b464f2f7","resolution":{"observed_at":"2026-08-03T16:30:39.261453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-03T16:30:39.321612Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.321612Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:3b9ccd3e1cfa11b440497b57ccaf09ac6690cd31c9cf78cc7ac2059b361c0964","observation_id":"ff743ba2-f1ba-4f2e-a92c-58fd02cb41be","resolution":{"observed_at":"2026-08-03T16:30:39.321612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.444135Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.444135Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:9a9603f4ad8e2569bf784f5ba1ec16166f956205f8848631b37a5b1f81433ff6","observation_id":"b2b28a9d-f196-468a-b568-d28665937126","resolution":{"observed_at":"2026-08-03T16:30:39.444135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-03T16:30:39.500409Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.500409Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:d4ea62a8423cb957b0b9c1818ace0d4573d04540760197f302d375f1ec14d1c2","observation_id":"697de81c-4365-4064-9772-1108bc316543","resolution":{"observed_at":"2026-08-03T16:30:39.500409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.609205Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.609205Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:2d8c4bf1c54597581a66ba9d09926d8b72491694dd820093784cc680f0265c60","observation_id":"c7ec8840-3b21-4209-98b5-fa134dc439b1","resolution":{"observed_at":"2026-08-03T16:30:39.609205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-03T16:30:39.690354Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.690354Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:87978f6ab14ae366348a32aa538d6cde8b1226eaed69da7265443012db64a077","observation_id":"bc47b44f-f2a5-4b9d-8206-2a83171a46a9","resolution":{"observed_at":"2026-08-03T16:30:39.690354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-03T16:30:39.753939Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models.arXiv preprint arXiv:2308.06721,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.753939Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:664c9bd9db4d82c16229eb4a8057151cd5264a774dc4708525f1ee3fb38fbc2e","observation_id":"7ef293b0-cfe9-45be-98c4-564a80875a1b","resolution":{"observed_at":"2026-08-03T16:30:39.753939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.826431Z","title":"Real3d-portrait: One-shot realistic 3d talking portrait synthesis.ICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.826431Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:a68b43c453aec91e1c5ab05b2261f066950d185a64591de1f5dfa9eb33e44dab","observation_id":"fc693490-f38d-4fd0-87b7-d482deef00c1","resolution":{"observed_at":"2026-08-03T16:30:39.826431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.882819Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.882819Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:728f5843ee2371fc49912159414bffb5e05bf86d20c08c84bd99ae40b0d9350a","observation_id":"ac30a21f-9050-49d2-9389-d6189c4f4a24","resolution":{"observed_at":"2026-08-03T16:30:39.882819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:39.994204Z","title":"Mimicmo- tion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.994204Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:5aa7409ed12c7267b5c476febfee354203f059918433186b8eded91868458648","observation_id":"76a5c066-29ab-4f57-b98b-acf33db80f00","resolution":{"observed_at":"2026-08-03T16:30:39.994204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.064138Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.064138Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:30923bdbc292cb9f0d3c0d9027914b975979ab843e17bd7c6518527b98f1b97a","observation_id":"c35f110c-30da-43c8-8594-4d4e93781f0f","resolution":{"observed_at":"2026-08-03T16:30:40.064138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.120294Z","title":"Ilsh: The imperial light- stage head dataset for human head view synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.120294Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:d01ea1ae76c3f2c6059f7a96ba002a024195785894c43f054330954e227f92b6","observation_id":"21ebe2c0-91ce-485d-9fc4-08c0052c3459","resolution":{"observed_at":"2026-08-03T16:30:40.120294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.190583Z","title":"B¨uhler, Xu Chen, Michael J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.190583Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:13dcd7fed9e5ddf6a47710bf7f9bbd91e45eb3aaefc8f68bd7e1d78c795ce7ea","observation_id":"5a29f13e-d058-458c-9746-b63839fe5b4b","resolution":{"observed_at":"2026-08-03T16:30:40.190583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-03T16:30:40.316004Z","title":"Magicvideo: Efficient video generation with latent diffusion models.arXiv preprint arXiv:2211.11018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.316004Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:820f1fa062b368792c0fc0b79404df700e8c1dd20cd28d9070304b767edbf44a","observation_id":"8ebe6b7d-b312-4357-8c2b-290b972c8fe8","resolution":{"observed_at":"2026-08-03T16:30:40.316004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.445550Z","title":"CelebV- HQ: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.445550Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:70c86fca82766922c87950d67414416c6285d816d3a5ad6a7b398686a8486d3e","observation_id":"9860946a-f8c4-4167-ad30-9ee003bb6dbd","resolution":{"observed_at":"2026-08-03T16:30:40.445550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.568751Z","title":"Champ: Controllable and consistent human image an- imation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.568751Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:60a5030873c14b06e28f556371250e5edf447939da7919b39f6e607d6d01c9c9","observation_id":"ef0c333e-bd7a-4404-9e9e-d197366969ae","resolution":{"observed_at":"2026-08-03T16:30:40.568751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.730781Z","title":"Webface260m: A benchmark unveiling the power of million-scale deep face recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.730781Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:4628c0a9e5e60cf7f6b8dedd1c80677bccb11a774712e665d98bf5becad74ac9","observation_id":"f5ecf44e-a19b-49ab-b12e-ae5dd013550a","resolution":{"observed_at":"2026-08-03T16:30:40.730781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:40.887733Z","title":"in-the- wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:40.887733Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:99c0b226964762e26e7a0f2f2e27142b06c33c41e93a1cfdcb4a603f36dc95d9","observation_id":"0601cb3c-0ac3-41c5-99e2-462d3e251d58","resolution":{"observed_at":"2026-08-03T16:30:40.887733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T16:30:41.029982Z","title":"in-the-wild","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:41.029982Z"},"links":{"citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:050f6f0fa7793627aec31af91347fb918675ba24cc5250806fc3982c05ffc57e","observation_id":"75d4d27b-7a0e-4cb8-af1d-913e06ed112e","resolution":{"observed_at":"2026-08-03T16:30:41.029982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":87,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2512.13247."}