{"as_of":"2026-08-22T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0ee414e646c6fb70365e63bb8001fc2365cd07e5e8fbd9462fc440aa7fa03d9c","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T22:45:39.443440Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.31294/citation-record","integrity":"/paper/2605.31294/integrity","json":"/paper/2605.31294/citation-record.json","paper":"/paper/2605.31294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:8d149a283c0a8ef981d7011177e70ada0f028bb097bdb4e4cfeb48bd91005c40","observation_id":"238f65e8-cfd0-4a26-9957-7a4733319a1c","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Distributed by Warner Bros","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:b2149343c6e2444598671a0a8e7e2c80a47167c051dc5e0ea0f4bbd9b01af896","observation_id":"62fac434-eb11-4576-8a5c-137dd0a46e75","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Gesturediffu- clip: Gesture diffusion model with clip latents.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:c5c2b278c370124fe56f20946a455f49572637ce8eb213c4074f44ffd9c18258","observation_id":"dbd75caa-c90c-48b8-bc4b-f1eb4b076a1b","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"wav2vec 2.0: a framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:a21ca76e46c2b1c951c8851a928cdd231868996b1c7911a2a454be346014cd51","observation_id":"d5779646-f04e-4321-b3a1-3406597830be","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:5b6cc753e2d26a5629420fa5ecf06d44dfd7571f0cd365e470ee2f25c1f8ab5d","observation_id":"c3532c69-855b-40a1-b1c8-d71ee4263583","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Cohen and Dominic W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:73cd73517c05025bbd187667c5d0441783fa10d113d8e3b12cefd181d8b3ac30","observation_id":"a3a26bec-6bf7-4ffc-934d-f9004d3e69be","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Emotional speech-driven animation with content-emotion disentangle- ment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:49c9bfd151807f0efcc6ccee08f47bb7d8c3031e0dc75397cc6c424763c84476","observation_id":"2e791cee-e7e1-48d0-a22e-f06f8b8e55d7","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:a52097706e46bdb6d0d329b107dc8c482ef3b8b5ae90f4e9850c03480a2dd3e5","observation_id":"4772aacd-727b-45ab-8376-35d1485ee341","resolution":{"observed_at":"2026-07-01T19:25:59.875366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"CosyV oice: A Scalable Multilin- gual Zero-shot Text-to-speech Synthesizer based on Super- vised Semantic Tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:2580d2eec13c1061ddeeac58d95f2b26ef1f3662c7093656b72b51461965c235","observation_id":"3572fb52-23a1-45dc-8585-94bfc1396daa","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"High Fidelity Neural Audio Compression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:40e1add4aa620e270e9d4500dbd7427941fefd295cbe9f54df809b273f36693d","observation_id":"ab9c697c-b568-4e20-8332-32449bde583a","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"JALI: an animator-centric viseme model for expres- sive lip synchronization.ACM Transactions on Graphics, 35 (4):1–11, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:c3ddae7b9f2bde296090f57dae9cd165e65539515c6edcba1828148b9b28a404","observation_id":"54215726-8171-4e03-b9e1-15f1807f9e64","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Jali-driven expressive facial animation and multilin- gual speech in cyberpunk 2077","venue":null,"work_id":null,"year":2077},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:dba15a423e26b4e79c01cee9bba3c1a1ab339786bc42cbfd2559e3c69b4751d8","observation_id":"7c1e6fb2-4506-4646-b577-744c0bd4a6df","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Papka, Sanjif Shanmugavelu, Darshan Gandhi, Hengyu Zhao, Dun Ma, Kiran Ranganath, Rick Weisner, Jiunn-yeu Chen, Yuting Yang, Natalia Vas- silieva, Bin C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:0dbed339867e791ed6c5c3e0a4b1fb2d020268b8b5dd46556f85a669e005f805","observation_id":"d237f36a-daad-46c6-a01e-272f84860120","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Faceformer: Speech-driven 3d facial anima- tion with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:e4b5f5240e6d122af4b7ea13e0bfd6893d963a025b50fead0058137d1df17eb6","observation_id":"3cd5da28-e73a-4841-b2a2-47e90f21f24b","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:298df7bf4ca0a85d053b0f6a4d71b28d313d1b99476b4ab1e49901fb61c9fa3a","observation_id":"a43b7391-d3e0-4f63-9793-c00a05313c7a","resolution":{"observed_at":"2026-07-01T19:25:59.872963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Tiny is not small enough: High quality, low- resource facial animation through hybrid knowledge distil- lation.ACM Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:3b85fb4862e5df4f7572203451d30f8f8c75eee0ccbbe65577eb0bad375b39f8","observation_id":"abb55630-1a12-4b13-8d71-a9c68bac0533","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Classifier-free diffusion guidance, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:bc14acd2b3cf4dcbebad66c8df45d373ad99fb4966424b6f696588b415172aae","observation_id":"4f6a6edd-df17-4537-864c-70369f204574","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"HuBERT: Self-Supervised Speech Representa- tion Learning by Masked Prediction of Hidden Units","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:1b4e1138c2e34e0f88283dcc1173c8e2bb7980f60d194d73cbb3ccaa324e511d","observation_id":"05df52ea-6355-4b7f-907a-066a59850658","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Speed- aware audio-driven speech animation using adaptive win- dows.ACM Transactions on Graphics, 44(1):1–14, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:6a3cc8fe039cd3eb12e55a37763e20688fad2e81535f5ed2f684f8316114091b","observation_id":"a41fa6a5-1451-481f-a4ac-bd38485d0055","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Audio-driven facial animation by joint end- to-end learning of pose and emotion.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:7913a7ad6134578dc5a7844f2f076ce3ef9d2d7746e6d5ad8e1f0c1387059429","observation_id":"efda1815-324f-4f86-b2a5-ed21a5b461e8","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Audio Driven Real-Time Facial Animation for Social Telep- resence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:0c61ed286c70c230cdc67273df3858a2aeac0302efb2fdd19cbfac8956678948","observation_id":"2ca5f8fd-2dd8-44eb-8ea6-d08fca1f832f","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Ditto: Motion-Space Diffusion for Control- lable Realtime Talking Head Synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:db79d0839c0816169e2053a84e8c33617997f1a51403bce0491c713b89900d9f","observation_id":"3d9d66ad-16ec-46bf-a3b5-bd40822786e5","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:60f59d3660294f1fbeca0d45b6870e2efad84f8adaa21133ed725685f72538ac","observation_id":"79d377d4-9e4a-42c7-98b9-25a8f6d0c32e","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:51b64cd93e947d70cc6c45622e77153ba97beb759b1b75993be8d724dff12c64","observation_id":"8aa55d09-f1d0-469c-b029-c07b142a810c","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Medtalk: Multimodal controlled 3d facial animation with dynamic emotions by disentangled embed- ding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:ae79a975bca967f2341807440594f50ff163e003b66c4e31fd2c31606d4a4e27","observation_id":"f3410bfb-594d-426b-bda8-2721f33ee2d6","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:4a14085a2efc035749c4686c178e1efe7c1f6a7184edcb58b88351e91a30678e","observation_id":"79612e0c-73df-4be6-bc9c-b3919089cbdd","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Learning to Listen: Modeling Non-Deterministic Dyadic Facial Motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:f3a475970fc2af1344dd876773d8745c124bd504baa877475f2798ee3cf9ca7a","observation_id":"07dfb8f3-ff33-4cea-abdc-4f6a4d9a3e96","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"S3: Speech, Script and Scene driven Head and Eye Animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:7ad74bfba44fe9369755841dc8186e32f1d47d817f4a97bf7a18508b99e46de6","observation_id":"9be75481-cf9d-4e5e-8798-347fafcece5d","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Model See Model Do: Speech-Driven Facial Animation with Style Control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:10b7a923cb6d0555d867dd78a593df15f771b0d414a51df6610996c3c2c0851e","observation_id":"6d82dc12-564a-4c37-b2ed-70bb7f0fd9e2","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"VOCAL: V owel and Consonant Layering for Expres- sive Animator-Centric Singing Animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:16243d370b6802cdc77e282a4b80a2f9980ea34090f2805b35dbe8940ae14fe5","observation_id":"291209c5-c984-4049-9279-e81a58391cd1","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face anima- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:d93acf39645cedaf9550f4061e761c42d5e1647b087b8d3f4024544181b7d599","observation_id":"7b52de19-93b2-47e4-8cf0-d8f8c09167df","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08223","last_updated":"2022-05-20T17:57:36Z","snapshot_observed_at":"2026-08-16T18:31:02.232574Z","submitted_at":"2021-04-16T17:05:40Z","title":"MeshTalk: 3D Face Animation from Speech using Cross-Modality Disentanglement","version":2},"cited_work":{"arxiv_id":"2104.08223","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.08223","snapshot_observed_at":"2026-07-01T19:25:59.876495Z","title":"Meshtalk: 3d face animation from speech using cross-modality disentanglement","venue":null,"work_id":"30c74ad8-f024-4baf-9fad-7d31dbe2f13e","year":2022},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2104.08223","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:5da40cff71bf5073e0396c80996d05aacde3a996bf49a6ff82926d6867274f79","observation_id":"32263147-47ed-47dd-9f1b-642f2e349f99","resolution":{"observed_at":"2026-07-01T19:25:59.878239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Facediffuser: Speech-driven 3d facial animation synthesis using diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:54de9cf50c361fac58948d765cfbb26665ece6a906d1728f29224b7911a02ed4","observation_id":"967994d3-5c40-4bf5-842d-817651597e48","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models.ACM Transactions on Graphics (TOG), 43(4):1–9, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:9e9e730c305a979f1b3c83e35023cfce14f9e8e5603174af82d5d4b479fa582d","observation_id":"90065ea2-fb1a-4410-8037-b2c763e14fe5","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Turn-taking and Backchannel Pre- diction with Acoustic and Large Language Model Fusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:3bf62d67436a531c5610fc975f111a3dfaee7f464b7bea14da7bc190014cbe14","observation_id":"52bde93e-af66-4805-b399-951e31defd30","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Mini-Omni2: Towards Open- source GPT-4o with Vision, Speech and Duplex Capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:65cb61a24300bc5444562a885be1798dfb51ef48735e9fdb026f591b3242822c","observation_id":"44551fb8-e48a-4d2a-ae1d-92cf84f5b19e","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"CodeTalker: Speech- Driven 3D Facial Animation with Discrete Motion Prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:a5e6c2bb2c8e0e8843247e60d68bb583708bfeffed876a54d60c521792887233","observation_id":"0104c4ab-a40e-4fce-9807-77c703ecd44d","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Qwen3-Omni Technical Report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:aef8723f874587bb92b19c8eb04fcaa1acf3e1b6612e637314783fd7242777e1","observation_id":"3451b55e-0307-477a-9c11-d0d79c910593","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"SoundStream: An End- to-End Neural Audio Codec","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:185a510ad60dbc87a23f290826eb0593d653878167578e85a2023befd57e2a33","observation_id":"5f6bdf2e-4e14-4bb1-b8fc-ead13aa08ea3","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"GLM-4-V oice: Towards Intelligent and Human-Like End-to- End Spoken Chatbot","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:3e849f8ae0217784d2f723fabd13b6668e980a4b47595fbf5e0c64db8d0a8aa1","observation_id":"81eba8c8-9cd8-481e-9cd2-2950c9081ecf","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"SpeechGPT: Empow- ering Large Language Models with Intrinsic Cross-Modal Conversational Abilities,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:d9b485273639fad546d4d25499a29e77f489c24a621719014d0fc5c3357b851b","observation_id":"88007d3d-7bfe-4564-ac77-bf6a81eed46a","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:38786d590e3beae9fd583d8b84ffffc05e10addf6fa8a4409e1741d378cfd9a0","observation_id":"6e21ec83-4b02-455c-bbde-4dc4cebada0c","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T22:45:39.443440Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:961cba630310326d3561ed563190239b6e9c86192f38eb9b7d3319bbaa0a44d6","observation_id":"bce2bbe5-805f-4ba4-b43a-2e806622f345","resolution":{"observed_at":"2026-06-28T22:45:39.443440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15687","last_updated":"2024-01-30T08:23:23Z","snapshot_observed_at":"2026-08-16T14:23:53.247176Z","submitted_at":"2024-01-28T16:17:59Z","title":"Media2Face: Co-speech Facial Animation Generation With Multi-Modality Guidance","version":2},"cited_work":{"arxiv_id":"2401.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.15687","snapshot_observed_at":"2026-07-01T19:25:59.868940Z","title":"Media2Face: Co-speech Facial Ani- mation Generation With Multi-Modality Guidance, 2024","venue":null,"work_id":"81aa9539-2c61-40fb-acda-90c2923a5495","year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2401.15687","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:a863891c960876a871d86fadaa7b3c3483343aa6386cdca1db5b9ad3a184ac76","observation_id":"6463b96a-c5fd-4f12-8615-7bbbc3e40e76","resolution":{"observed_at":"2026-07-01T19:25:59.870529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.31294."}