{"as_of":"2026-08-10T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f9c260a1a7d89d471081454f894e3d4f42da02edd8288b306d85f93737c7909","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:01:30.793099Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:45:46.122397Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.706870Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-10T06:34:19.642342Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:6fdfc98299ecb89814cb6f203e971a3adce0b34de7fc5dfcddadd9b3aee78fc5","observation_id":"53c7a565-32d3-4fa6-b7a2-cba71f4677f3","resolution":{"observed_at":"2026-05-17T01:58:51.499544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-03T18:39:41.196491Z","title":"Midas: Multimodal interactive digital-human synthesis via real-time autoregressive video generation.arXiv preprint arXiv:2508.19320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-10T06:34:19.642342Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.196491Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:95865e1ad3931252d355a1db5acb9393f5a98d9f440efd3469c45076b9c58fa4","observation_id":"0cb89d86-de96-464c-a2f5-08274b1f2d33","resolution":{"observed_at":"2026-08-03T18:39:41.196491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2512.10571","last_updated":"2026-05-02T11:27:08Z","snapshot_observed_at":"2026-08-09T20:09:40.542255Z","submitted_at":"2025-12-11T11:58:53Z","title":"AVI-Edit: Audio-sync Video Instance Editing with Granularity-Aware Mask Refiner","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T23:26:21.855485Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.10571"},"observation_digest":"sha256:e492327d192d4b3166ba2e243854d92ceccbc7396d327ee82a0e3586f29ae00c","observation_id":"108d7ebf-e767-4e25-bd24-cec23c714294","resolution":{"observed_at":"2026-05-16T23:28:40.883660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":148,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:f8b7c39e9b6dc4fd37096a47acdf5ee0dcebc960e3b932abc0501cfe3fef9d3f","observation_id":"665fde9b-a8a6-4d66-a681-4e7eac0bc3bb","resolution":{"observed_at":"2026-05-11T08:30:56.876833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Midas: Multimodal interactive digital-human synthesis via real-time autoregressive video generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:ac872e186a77cd086b662e1d17d77e727a915cf23463ab5df492b5658beb18bd","observation_id":"5db50733-5e4c-431f-b55a-f56a089308b9","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:66b44c89af7929aa2344eb49c43a1197ef90da3d002acab55007fd7f579d6c6a","observation_id":"4b8026f9-42e5-4e45-b571-5ba2bc0952fb","resolution":{"observed_at":"2026-05-11T15:16:11.366786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.10079","last_updated":"2026-05-11T07:01:38Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T07:01:38Z","title":"SocialDirector: Training-Free Social Interaction Control for Multi-Person Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T03:28:30.471533Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.10079"},"observation_digest":"sha256:97653cda790aae3c2f8c3002440abbe6a9c4ba2091cf1073bd1bc5f2a25acd57","observation_id":"f2f4e523-8418-4ece-a17a-6951507b5999","resolution":{"observed_at":"2026-05-12T07:21:23.960771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2605.18467","last_updated":"2026-05-18T14:27:05Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:27:05Z","title":"InstructAV2AV: Instruction-Guided Audio-Video Joint Editing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T11:34:32.558440Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2605.18467"},"observation_digest":"sha256:38c6ba399877ede47dfef3283a638c8c9b433685a7c351254e861768d42dd655","observation_id":"add3ca7b-f2a2-4f9d-a150-b6b9f950d996","resolution":{"observed_at":"2026-05-20T11:38:14.757856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:68e381948e1bc93def910782c0fdefc19fe956ebea2c1ea220034199c0c76aa2","observation_id":"49a4d07d-3d86-40f9-95b8-099f10a15b9a","resolution":{"observed_at":"2026-07-04T16:49:57.708442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:874b0227bcc8d267e62d5c9cabf42a9b47abed7d0656840a51d2e68097707d89","observation_id":"b7e421ae-0ffe-48aa-b59e-219dd8b4607d","resolution":{"observed_at":"2026-07-04T13:09:50.999411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:a60cb2ec2c4336daf2662d9b97bd32593faf6a0b22394ac4d5ff825bed5f54e5","observation_id":"482642b1-8e99-4271-acf3-86030bcb6b72","resolution":{"observed_at":"2026-06-30T09:44:37.344060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":"2508.19320","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-07-04T16:49:57.706870Z","title":"arXiv preprint arXiv:2508.19320(2025)","venue":null,"work_id":"e566218a-a83c-4d10-8baf-b666449b61ea","year":2025},"citing_paper":{"arxiv_id":"2606.27779","last_updated":"2026-06-26T07:11:10Z","snapshot_observed_at":"2026-08-07T20:53:29.333353Z","submitted_at":"2026-06-26T07:11:10Z","title":"MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:04:31.366845Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2606.27779"},"observation_digest":"sha256:8be21161ad317cb33af97aef6fc736106ee6673ba08d39d70a281a19267a98a2","observation_id":"0e7788fd-13a0-44e1-ab20-7915a5a6513e","resolution":{"observed_at":"2026-06-29T18:33:51.194113Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-01T03:52:55.445287Z","title":"arXiv preprint arXiv:2508.19320 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-06T04:02:53.538330Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.445287Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:bd5a88f5d425486a884b33314ef85b6442dd7582eb739c806c57b88a0dd3f65d","observation_id":"55e9fcb2-b64a-476c-802f-ffb5b005e91e","resolution":{"observed_at":"2026-08-01T03:52:55.445287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-04T06:45:46.122397Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:46.122397Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:e2cec5d07b864bee48dca3d1affe3092eab5de29acc35b6c139fca7bee9cdc3b","observation_id":"d958e652-9421-4996-b66f-9ef6324edd8e","resolution":{"observed_at":"2026-08-04T06:45:46.122397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.19320/citation-record","integrity":"/paper/2508.19320/integrity","json":"/paper/2508.19320/citation-record.json","paper":"/paper/2508.19320"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T16:01:30.733718Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.733718Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:7e7069fb296a3631dc7abdf78f5f9c2ecac42a01a1171b58b22ab5649cd8c9cb","observation_id":"17051457-5094-405d-b920-58048bd69c7d","resolution":{"observed_at":"2026-08-05T16:01:30.733718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-10T07:07:34.103841Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T16:01:30.743448Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.743448Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:e3366ddf08bbc19a8b925ee69ae25768ff66a7d685d972e1f808341c2b569e42","observation_id":"9079251d-3480-4c4e-a654-a288346b7d44","resolution":{"observed_at":"2026-08-05T16:01:30.743448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-05T16:01:30.751310Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.751310Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:89b8b8356f948bcbce7df0e621f7c5eb740090d0f7065570b3c8151ecb72f78f","observation_id":"58175350-9275-4437-beee-9c33f9f6a819","resolution":{"observed_at":"2026-08-05T16:01:30.751310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T16:01:30.758960Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.758960Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:78733b7f9a3e599a5c9d3464628b09b469f7579a24f69a55149a35025f3e381d","observation_id":"87e2ecc3-0a5f-4fa9-ba94-ac0d8c4a75e5","resolution":{"observed_at":"2026-08-05T16:01:30.758960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T16:01:30.762208Z","title":"Let them talk: Audio-driven multi-person conversational video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.762208Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:811ade0cc86457b45797207b8a4cb6ad184f16b8e9189d86b818750f89976234","observation_id":"b7dc1f40-57f5-44e4-a77f-f664e284d62b","resolution":{"observed_at":"2026-08-05T16:01:30.762208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-09T16:40:37.792241Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T16:01:30.764940Z","title":"Omnihuman-1: Re- thinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.764940Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:1e0de6d81c5d31b804661837893a5da0d8ce31df5219579699e3c8d17c1ad73e","observation_id":"b49db34c-bbd5-4f14-8308-656af95ccf76","resolution":{"observed_at":"2026-08-05T16:01:30.764940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-08-07T11:06:29.471810Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-05T16:01:30.768612Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.768612Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:98052518e8202b2a015b8e66a721defd8c161eb1c12ac61b7507c0c1d24175e1","observation_id":"fe4cfe71-a521-4a47-b5ef-56faa10a8e68","resolution":{"observed_at":"2026-08-05T16:01:30.768612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:30.941816Z","title":"V oxceleb: A large-scale speaker iden- tification dataset","venue":null,"work_id":"0e497f49-ec89-4de3-b502-0924367d5d44","year":2017},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.772271Z"},"links":{"citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:9f63accbc746d333e791e2eca4bfd9b25e612a78b0a00df58329837b4f01b2b4","observation_id":"a9928428-2bc5-4a59-b748-6472665c45af","resolution":{"observed_at":"2026-08-05T16:01:30.946894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T16:01:30.778327Z","title":"org/abs/2212.04356","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.778327Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:c53e572d702073921e0784dc07defc750f5fb60134a17e73d7841049b0f1b25c","observation_id":"2a1348e7-2ac6-4672-8192-6cbeaeab58f0","resolution":{"observed_at":"2026-08-05T16:01:30.778327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-05T16:01:30.781337Z","title":"Magi-1: Autoregressive video generation at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.781337Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:61acd84bb986c2638b1ca83fca08af0545a1c980a2b8c6787e55e4ca54819f6b","observation_id":"be07b53f-fc56-413b-b096-767400a84c2a","resolution":{"observed_at":"2026-08-05T16:01:30.781337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-08T20:25:42.487197Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T16:01:30.783917Z","title":"Emo2: End-effector guided audio- driven avatar video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.783917Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:b5418bcc9898f0156acb09ced73f034bfed8e17af16081b2f2377ef6c922b72b","observation_id":"c3902634-2cbb-4768-91eb-efa0626f97cf","resolution":{"observed_at":"2026-08-05T16:01:30.783917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14837","last_updated":"2025-04-24T03:03:57Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T07:46:07Z","title":"Diffusion Models Are Real-Time Game Engines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14837","snapshot_observed_at":"2026-08-05T16:01:30.787197Z","title":"Diffusion models are real-time game engines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.787197Z"},"links":{"cited_paper":"/paper/2408.14837","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:98c76bf64d39e9dc4a3734f987757231b17356c3f5e7d48061d938b4775f8ebf","observation_id":"5abb561e-3940-4e21-9c09-452074a8ff51","resolution":{"observed_at":"2026-08-05T16:01:30.787197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-07T16:33:53.883380Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-08-05T16:01:30.775017Z","title":"Chatanyone: Styl- ized real-time portrait video generation with hierarchical motion diffusion model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.775017Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:e0967bc518076bf262eca0c5a82d7d6b1fee19fb53da0f9bbe89b82761f89757","observation_id":"fb3361aa-f299-458b-9e9d-02fd7de75b16","resolution":{"observed_at":"2026-08-05T16:01:30.775017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02879","last_updated":"2024-08-06T01:13:09Z","snapshot_observed_at":"2026-08-10T05:15:57.833877Z","submitted_at":"2024-08-06T01:13:09Z","title":"Body of Her: A Preliminary Study on End-to-End Humanoid Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02879","snapshot_observed_at":"2026-08-05T16:01:30.737383Z","title":"Body of her: A preliminary study on end-to-end humanoid agent","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.737383Z"},"links":{"cited_paper":"/paper/2408.02879","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:9033964d00ed054f08d4b0dc598c11e33e093f7fe25a0af78bf70be2e292c3e9","observation_id":"e9078eba-f632-477d-9580-59079727a280","resolution":{"observed_at":"2026-08-05T16:01:30.737383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-07T20:48:48.663695Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-05T16:01:30.790252Z","title":"Mocha: Towards movie-grade talking character synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.790252Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:2378fd80045538ab0c8c7a082178f4a56d9da542e8b9bb3656b140c33d96abc4","observation_id":"e3481134-6850-4cd3-8ffa-015982987b44","resolution":{"observed_at":"2026-08-05T16:01:30.790252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19325","last_updated":"2025-05-18T02:27:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T03:38:06Z","title":"Long-Context Autoregressive Video Modeling with Next-Frame Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19325","snapshot_observed_at":"2026-08-05T16:01:30.747278Z","title":"Long-context autoregressive video modeling with next-frame prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.747278Z"},"links":{"cited_paper":"/paper/2503.19325","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:b5f27b8c504c26a4ee7c2d4637b2a1affd91eda3406ebf55fb77ef84261b37b4","observation_id":"c3dc2ccd-0c20-40ec-9c59-4cc98d8737e8","resolution":{"observed_at":"2026-08-05T16:01:30.747278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T16:01:30.793099Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.793099Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:f41f0181d096312b6823b7c4c887148e0e895e420e2998b039f762a6e02635c2","observation_id":"6b852dd8-9b9b-4d85-8dee-48b1a43d6c9b","resolution":{"observed_at":"2026-08-05T16:01:30.793099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19833","last_updated":"2025-06-24T17:50:16Z","snapshot_observed_at":"2026-08-06T22:59:27.051058Z","submitted_at":"2025-06-24T17:50:16Z","title":"Bind-Your-Avatar: Multi-Talking-Character Video Generation with Dynamic 3D-mask-based Embedding Router","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19833","snapshot_observed_at":"2026-08-05T16:01:30.754418Z","title":"Bind-your-avatar: Multi-talking-character video generation with dynamic 3d-mask-based embedding router","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.754418Z"},"links":{"cited_paper":"/paper/2506.19833","citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:6e9e2da0400fd29f8c6d66c90abd36a26898e2b45a2e2ed15f7f11bfbae82678","observation_id":"637da00f-17f4-4838-b577-1697b3dc2884","resolution":{"observed_at":"2026-08-05T16:01:30.754418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:01:30.954041Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":"11f463b8-ff88-47f4-9123-21724506cb06","year":2018},"citing_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T16:01:30.740367Z"},"links":{"citing_paper":"/paper/2508.19320"},"observation_digest":"sha256:26ebc76b9dfa9bba3e2330aaa660b1318f003fd5709e4429100fd3a2e48dd0ee","observation_id":"7e51af2a-bd1f-4de3-bd17-ae5ac711161a","resolution":{"observed_at":"2026-08-05T16:01:30.957306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T02:00:04.850473Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 14 inbound Pith citation observations for arXiv:2508.19320."}