{"as_of":"2026-08-18T21:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:07188943e76452dc30dd9a7e21c0fda31e9553963c19194907d5d206e2e36fdf","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T17:08:15.828466Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24359/citation-record","integrity":"/paper/2607.24359/integrity","json":"/paper/2607.24359/citation-record.json","paper":"/paper/2607.24359"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-31T17:08:10.808518Z","title":"arXiv preprint arXiv:2501.00103 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:10.808518Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:05f6788a5b443be720f59819506af679d69ef3a068e6fa7dfa57cc54539cf27d","observation_id":"afbb5a84-d57c-4c63-b9eb-11b440baf5be","resolution":{"observed_at":"2026-07-31T17:08:10.808518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-08-18T20:29:58.857701Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-31T17:08:10.869402Z","title":"arXiv preprint arXiv:2601.03233 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:10.869402Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:421c0ee8453f2a3eee921168950052dd2659f6804dcc7c2bd1a5ce124a02e5d6","observation_id":"1741ac06-1e44-4a9c-b772-d25581ce2933","resolution":{"observed_at":"2026-07-31T17:08:10.869402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:10.962028Z","title":"arXiv preprint arXiv:2602.19163 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:10.962028Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:ad0201eb98bb58805a05a5d01c05ee36fb196f3c9f4b706c8e59be13db8b03c9","observation_id":"0cf3ad71-e6e9-42ab-8c86-23e14ed958af","resolution":{"observed_at":"2026-07-31T17:08:10.962028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-13T04:37:51.305325Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-31T17:08:11.055148Z","title":"arXiv preprint arXiv:2510.01284 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.055148Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:a8b9d09c335bd375d47ae1e95d31b21534d694e73a55b2390fad923172c330b6","observation_id":"fde1708e-8ba1-4017-a235-bf00af4b78cc","resolution":{"observed_at":"2026-07-31T17:08:11.055148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:11.138902Z","title":"arXiv preprint arXiv:2602.08794 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.138902Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:ce37c41fe7872569e16f612972144a1669d5266e11dd94829f9cae15e95f9106","observation_id":"6446311b-761f-4a01-a7d6-a5a2b22d0b70","resolution":{"observed_at":"2026-07-31T17:08:11.138902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16423","last_updated":"2024-01-29T18:59:55Z","snapshot_observed_at":"2026-08-18T14:40:34.579640Z","submitted_at":"2024-01-29T18:59:55Z","title":"Synchformer: Efficient Synchronization from Sparse Cues","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16423","snapshot_observed_at":"2026-07-31T17:08:11.199202Z","title":"arXiv preprint arXiv:2401.16423 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.199202Z"},"links":{"cited_paper":"/paper/2401.16423","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:77a22e189f97dcf2cb1ab4830af4b2fce82322ec46e919a35a6b34495c308a5e","observation_id":"1683a06b-e2c7-4425-8576-8e81b46a80be","resolution":{"observed_at":"2026-07-31T17:08:11.199202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-07-31T17:08:11.295916Z","title":"arXiv preprint arXiv:2503.20215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.295916Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b0bcdf117ac853446a3278f32d05220f77459f0e9fb53c5b6267866b4583c4bb","observation_id":"c95b299b-c5c2-40ce-a8b2-630aaa13ac01","resolution":{"observed_at":"2026-07-31T17:08:11.295916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-08-18T04:33:43.789044Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17800","snapshot_observed_at":"2026-07-31T17:08:11.387051Z","title":"arXiv preprint arXiv:2606.17800 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.387051Z"},"links":{"cited_paper":"/paper/2606.17800","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:e918b788366773bd421bc3da90b2837980f2dc09e8dd925a4e71f6ce4cbfa9d3","observation_id":"f3234e59-a1b2-4445-9564-286c13ffc4a2","resolution":{"observed_at":"2026-07-31T17:08:11.387051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:11.478913Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.478913Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:95c11c767d28f18f47ebb5b12f3738261445c92bf232ac8dbbd92e163e67d498","observation_id":"9d854e0a-7873-497d-a516-2e0dca68bb2f","resolution":{"observed_at":"2026-07-31T17:08:11.478913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02214","last_updated":"2026-06-01T14:32:37Z","snapshot_observed_at":"2026-08-17T22:01:08.736822Z","submitted_at":"2026-02-02T15:19:22Z","title":"Causal Forcing: Autoregressive Diffusion Distillation Done Right for High-Quality Real-Time Interactive Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02214","snapshot_observed_at":"2026-07-31T17:08:11.567184Z","title":"arXiv preprint arXiv:2602.02214 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.567184Z"},"links":{"cited_paper":"/paper/2602.02214","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:daf7fa19b43e97b3241e66b8e4465a0d86175db58221b1e66709ea5b9a72f313","observation_id":"a98bc362-28ea-4dfa-a940-05723b969c4a","resolution":{"observed_at":"2026-07-31T17:08:11.567184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-31T17:08:11.655887Z","title":"arXiv preprint arXiv:2512.04677 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.655887Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:6e26cca723281bbc4eb173ce0f2c5c9530ad159454e6780250dff3a3e735b16c","observation_id":"8cbe9111-a429-44bd-9408-8e140c0c33b2","resolution":{"observed_at":"2026-07-31T17:08:11.655887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-15T18:39:33.154486Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-07-31T17:08:11.760995Z","title":"arXiv preprint arXiv:2506.18866 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.760995Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:0c6598e923652f54e523292687762ccff940ea68b9597aa1dc0f0ae10a5d3bfc","observation_id":"2970e68b-c85d-4f14-bbe3-0cfff9069dd8","resolution":{"observed_at":"2026-07-31T17:08:11.760995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-18T02:40:00.948380Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-31T17:08:11.848419Z","title":"arXiv preprint arXiv:2508.08248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.848419Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:dca1b3ca25a36dfe98cafc8b42d64154eba40e89adcbfc3b4bae95e2e390f2f4","observation_id":"94d852de-3e98-4137-a7e8-b664b39ce114","resolution":{"observed_at":"2026-07-31T17:08:11.848419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-08-15T01:56:17.706891Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-07-31T17:08:11.944416Z","title":"arXiv preprint arXiv:2508.18621 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.944416Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:c0cd90f55e1dd10115707930dd573d69bbc95f6c0efa293b8a83ba4a5fb63750","observation_id":"32ba9d0c-e283-4059-9009-9515cc4f2452","resolution":{"observed_at":"2026-07-31T17:08:11.944416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.038694Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.038694Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:608097381e4bf2a914642439094ac8934e8cbe6b92ee463be643448ede1e21f7","observation_id":"ba60275e-8ed0-41a6-a7e6-b21d7d08d97b","resolution":{"observed_at":"2026-07-31T17:08:12.038694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.103154Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.103154Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3cc014e955d0d21348139ffba543cb7231a1dfd2a06223144696dadedca40c03","observation_id":"b7c802f1-d650-4f64-b997-0d9132117e33","resolution":{"observed_at":"2026-07-31T17:08:12.103154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18739","last_updated":"2026-05-19T17:46:12Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:03Z","title":"LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18739","snapshot_observed_at":"2026-07-31T17:08:12.197184Z","title":"arXiv preprint arXiv:2605.18739 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.197184Z"},"links":{"cited_paper":"/paper/2605.18739","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3593a55e65eeb66a57d820b4afd5b629b3f02b02c6f1cb25a27b6af1b4414654","observation_id":"e42f82a0-7c1b-4847-86b9-c1aef82eee3d","resolution":{"observed_at":"2026-07-31T17:08:12.197184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25819","last_updated":"2026-04-28T16:28:05Z","snapshot_observed_at":"2026-08-16T09:10:11.531906Z","submitted_at":"2026-04-28T16:28:05Z","title":"Mutual Forcing: Dual-Mode Self-Evolution for Fast Autoregressive Audio-Video Character Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25819","snapshot_observed_at":"2026-07-31T17:08:12.280455Z","title":"arXiv preprint arXiv:2604.25819 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.280455Z"},"links":{"cited_paper":"/paper/2604.25819","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b78fad04e154b2f98260929007e950776e30faae304dc2be85432814c1b495cd","observation_id":"c5b24e07-50b4-45b5-83b0-022cd6e8aa5b","resolution":{"observed_at":"2026-07-31T17:08:12.280455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.372593Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.372593Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:72c5c215d6dc71c8d1262b2cf2a8638e4c7a13891aa06e426c3686f217866aa2","observation_id":"5ad092f6-2c7a-4014-9130-152565f70652","resolution":{"observed_at":"2026-07-31T17:08:12.372593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.435582Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.435582Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:409087c32c61bc46ae00821dfe2023b8ff42442b3522240d036e31f0c614660d","observation_id":"969ed58c-104b-4902-ab14-fc3ec4745a3c","resolution":{"observed_at":"2026-07-31T17:08:12.435582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13035","last_updated":"2026-06-11T08:16:08Z","snapshot_observed_at":"2026-08-13T09:39:05.998881Z","submitted_at":"2026-06-11T08:16:08Z","title":"TetherCache: Stabilizing Autoregressive Long-Form Video Generation with Gated Recall and Trusted Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13035","snapshot_observed_at":"2026-07-31T17:08:12.523137Z","title":"arXiv preprint arXiv:2606.13035 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.523137Z"},"links":{"cited_paper":"/paper/2606.13035","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:eeed1d0d4cf8d8d9d2b9910e1ab94866a6c77a9376abe6d7d47a8827a0c4fdab","observation_id":"9336be64-adaf-4330-b14b-2d8a0cb4a365","resolution":{"observed_at":"2026-07-31T17:08:12.523137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13111","last_updated":"2026-05-13T07:23:02Z","snapshot_observed_at":"2026-08-11T12:42:28.865032Z","submitted_at":"2026-05-13T07:23:02Z","title":"Pyramid Forcing: Head-Aware Pyramid KV Cache Policy for High-Quality Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13111","snapshot_observed_at":"2026-07-31T17:08:12.587978Z","title":"arXiv preprint arXiv:2605.13111 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.587978Z"},"links":{"cited_paper":"/paper/2605.13111","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:22788449c9106bbabd872750c9c9a58f347dcd8690f20c0099354490aa121783","observation_id":"14635ca1-3bc5-4145-9181-a50b32ccc305","resolution":{"observed_at":"2026-07-31T17:08:12.587978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21221","last_updated":"2026-04-23T02:22:25Z","snapshot_observed_at":"2026-08-17T14:18:20.258187Z","submitted_at":"2026-04-23T02:22:25Z","title":"Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.21221","snapshot_observed_at":"2026-07-31T17:08:12.670011Z","title":"arXiv preprint arXiv:2604.21221 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.670011Z"},"links":{"cited_paper":"/paper/2604.21221","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:f24388315a3c192405ac75aff442ce105d6cc347e11d04726d8a220236cd315c","observation_id":"13e85bc7-ba70-424c-ad9f-c4ba0b0418ef","resolution":{"observed_at":"2026-07-31T17:08:12.670011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-08-18T13:36:07.854734Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19108","snapshot_observed_at":"2026-07-31T17:08:12.727266Z","title":"arXiv preprint arXiv:2411.19108 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.727266Z"},"links":{"cited_paper":"/paper/2411.19108","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:7785d29428a129201d3259650ba749e1f45aef57603934cf60e4ddeb349044b9","observation_id":"3c797104-23ac-4f2d-8747-6bb3179068d2","resolution":{"observed_at":"2026-07-31T17:08:12.727266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.782939Z","title":"arXiv preprint arXiv:2512.04519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.782939Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:4a2bcb7d2934cda06abf5f9a47c8070a44fa96de4886490d9e6b8f2d934e40ba","observation_id":"8d685791-6f11-4d7f-b643-05cd01129072","resolution":{"observed_at":"2026-07-31T17:08:12.782939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30349","last_updated":"2026-05-28T17:59:53Z","snapshot_observed_at":"2026-08-12T18:03:55.665799Z","submitted_at":"2026-05-28T17:59:53Z","title":"AdaState: Self-Evolving Anchors for Streaming Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30349","snapshot_observed_at":"2026-07-31T17:08:12.844794Z","title":"arXiv preprint arXiv:2605.30349 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.844794Z"},"links":{"cited_paper":"/paper/2605.30349","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:c4af7358bb56f6d40a6d77dfdbc69eba3426a28971f9b7d99d0b8f24af5af248","observation_id":"214fb60f-9156-4e18-bb12-13843a73bc59","resolution":{"observed_at":"2026-07-31T17:08:12.844794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31033","last_updated":"2026-05-29T09:04:26Z","snapshot_observed_at":"2026-08-18T02:08:02.506520Z","submitted_at":"2026-05-29T09:04:26Z","title":"SlotMemory: Object-Centric KV Memory for Streaming Long-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31033","snapshot_observed_at":"2026-07-31T17:08:12.899743Z","title":"arXiv preprint arXiv:2605.31033 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.899743Z"},"links":{"cited_paper":"/paper/2605.31033","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:715e74bf169a5e7bb46dabb7352aba68ed05eb2b3f1d6a76002bc144360da2a4","observation_id":"5d0b9a4f-ec0a-4791-9c46-bb643a2315a5","resolution":{"observed_at":"2026-07-31T17:08:12.899743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:12.967550Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:12.967550Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3baab7087073d6c61aee85b3114a26a1890dbf1a05cf68856c669beb54d44980","observation_id":"eabd918d-e32d-4721-9662-e7b74d19ccf2","resolution":{"observed_at":"2026-07-31T17:08:12.967550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.016996Z","title":"Proceedings of the 28th ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.016996Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:d2b6b49c99c061f820873626c56bdc998bc3e2b6083e6b03e4cb6f61f8316b9d","observation_id":"ef55d9fa-8106-4515-accb-5d0137222c4e","resolution":{"observed_at":"2026-07-31T17:08:13.016996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.100670Z","title":"Proceedings of the 40th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.100670Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:9de6a93b931776590aa0df40e713734ee7a1e759ed35fad71c2bfcbbdc250008","observation_id":"d2626c8f-4b28-4f3f-a628-d2e5f689ba9f","resolution":{"observed_at":"2026-07-31T17:08:13.100670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.07698","last_updated":"2022-09-04T16:26:45Z","snapshot_observed_at":"2026-08-18T03:15:25.981676Z","submitted_at":"2018-01-23T18:39:19Z","title":"ArcFace: Additive Angular Margin Loss for Deep Face Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.07698","snapshot_observed_at":"2026-07-31T17:08:13.153011Z","title":"arXiv preprint arXiv:1801.07698 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.153011Z"},"links":{"cited_paper":"/paper/1801.07698","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:89e09c42a79c7ed527ebc248481c5a29a28f725ae506e36d17a9614b8df03ac9","observation_id":"a2c90bb7-d6b4-44a4-9ab7-ee7ec9730bc1","resolution":{"observed_at":"2026-07-31T17:08:13.153011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.244276Z","title":"Advances in Neural Information Processing Systems , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.244276Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:389b7a8ac2807be107776c0ab65a92f2fb73e72b7a7bc4daa153d171fd1d85e2","observation_id":"3fed45d5-2d6d-4725-9780-e02633328580","resolution":{"observed_at":"2026-07-31T17:08:13.244276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.301353Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.301353Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b132b1085a501ab10a13fa78315ddb927d199c27eff88011fb6fad82cc18eaac","observation_id":"fd6ec734-6d05-464c-a05b-bc4c20568f8b","resolution":{"observed_at":"2026-07-31T17:08:13.301353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-07-31T17:08:13.357124Z","title":"arXiv preprint arXiv:2207.12598 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.357124Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:e63b33af1e3beef0617c07cec5b9844fd057a814b0486754ef43faef788f6982","observation_id":"33f72676-20b4-466d-b694-0ac571805571","resolution":{"observed_at":"2026-07-31T17:08:13.357124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.411709Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.411709Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:f42d1b42675a90c287512c09747259867f29f1fe74ffa6f72e756b00892e6021","observation_id":"cc6d6edf-ab42-46fe-af1f-d6cfa97a1846","resolution":{"observed_at":"2026-07-31T17:08:13.411709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.471060Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.471060Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:6b275bf09437e2b1e3c0f609dd0f1b36ca75be89b1b71ca240a9ef041a1e8f29","observation_id":"38fad70c-57a7-4f2c-a5dd-14614c8fd6e3","resolution":{"observed_at":"2026-07-31T17:08:13.471060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-31T17:08:13.522654Z","title":"arXiv preprint arXiv:2210.02303 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.522654Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:99dabbfded97a7f969a0e71daf89a22e1f237d4545c1fdb135c697d70c53f11f","observation_id":"158643de-393f-4bb6-930c-47e72f9941e3","resolution":{"observed_at":"2026-07-31T17:08:13.522654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-31T17:08:13.605014Z","title":"arXiv preprint arXiv:2209.14792 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.605014Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:d85be1eb54664e7de0a6887f551bdb986b77a746a10aac1f1ea7b59f3d8940bf","observation_id":"fb014591-8e1f-4ccb-a82b-b18656cd1236","resolution":{"observed_at":"2026-07-31T17:08:13.605014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.664811Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.664811Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:93e2015abcfadca85dbc6549b26e7e486de15ff569f6610bb3dc6f6b7c35aa9d","observation_id":"c288be8b-09f6-4e70-bd35-7d81c824385a","resolution":{"observed_at":"2026-07-31T17:08:13.664811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-17T12:45:30.627161Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-31T17:08:13.725418Z","title":"arXiv preprint arXiv:2311.15127 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.725418Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:7f2384edac8f51d21eb3a47adf610492510330b627922660a0a2be07fce77a05","observation_id":"62912e6a-219e-4fa3-9f30-cb9e727ba0a8","resolution":{"observed_at":"2026-07-31T17:08:13.725418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-07-31T17:08:13.765393Z","title":"arXiv preprint arXiv:2307.04725 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.765393Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:cfc1e1790c940f032b36f1310e02b5bc62ea729b2b697b12241578451ed0fece","observation_id":"8f5ade65-db20-449f-be8e-2005c6be44d5","resolution":{"observed_at":"2026-07-31T17:08:13.765393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-08-14T12:12:01.418974Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-07-31T17:08:13.802617Z","title":"arXiv preprint arXiv:2312.14125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.802617Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:f6cc39ed84caa80ec1daee53f98263d59a1b9d58876859d672d40ce0a20318fc","observation_id":"57efef5a-3e34-4d59-8684-9d2da48cd22b","resolution":{"observed_at":"2026-07-31T17:08:13.802617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.859653Z","title":"ACM Transactions on Graphics , volume=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.859653Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:a31dd4749b0168dbda32a39a1dc4b28fc440ee4d195f48916d97538eb6eaa1a5","observation_id":"28e0d6b0-0160-4cc8-adfc-3189137aef7c","resolution":{"observed_at":"2026-07-31T17:08:13.859653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.943297Z","title":"Proceedings of the Thirtieth International Joint Conference on Artificial Intelligence , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.943297Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:352df9fc256e3829a1ee954e40cff5d819d139e018bf528f50788836364e0337","observation_id":"d3eb3a28-80fe-4047-a2d1-eb4d657bba8b","resolution":{"observed_at":"2026-07-31T17:08:13.943297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:13.995052Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:13.995052Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:a92e71da186e40165c93ff514abf20b264d661a1b0541eba55f38aae6bc7adf1","observation_id":"39034f06-c57f-41b0-ba98-3c6b907e03ad","resolution":{"observed_at":"2026-07-31T17:08:13.995052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.053608Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.053608Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:101d47f3fc127d50626d3a05a5802aced44aa719c743e699b166d2f82fad6dac","observation_id":"a59eb5c0-319c-4df9-8202-3fea8b1d27a5","resolution":{"observed_at":"2026-07-31T17:08:14.053608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.139431Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.139431Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:25567e1243d9e57d42eea95592a286dde6ef15591f4b57e76fe45732889330db","observation_id":"696a6b74-0607-412a-b5b0-303a1c67cdcf","resolution":{"observed_at":"2026-07-31T17:08:14.139431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-31T17:08:14.198579Z","title":"arXiv preprint arXiv:2406.08801 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.198579Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:c1e296c27eedcf25a1a0cdbdd1622e3f0212bd5409325adf7aefae430517e427","observation_id":"44928e9b-9bca-4652-8a70-7e1e460e7b88","resolution":{"observed_at":"2026-07-31T17:08:14.198579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-18T14:48:47.548305Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-07-31T17:08:14.281071Z","title":"arXiv preprint arXiv:2407.03168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.281071Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:63df6a2e931a5bb6fcc83f66380331dcd44bf84dc139e4202647ba7ab7d58bdb","observation_id":"fcc72d5f-8e9e-4700-8344-c6ab3b19a06b","resolution":{"observed_at":"2026-07-31T17:08:14.281071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16498","last_updated":"2023-11-27T18:32:31Z","snapshot_observed_at":"2026-08-16T14:39:56.587145Z","submitted_at":"2023-11-27T18:32:31Z","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16498","snapshot_observed_at":"2026-07-31T17:08:14.342198Z","title":"arXiv preprint arXiv:2311.16498 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.342198Z"},"links":{"cited_paper":"/paper/2311.16498","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:8ceb3d3206de845f7d9f47fc9c6bc6fa388f8845e9e366506b1ba6e243c1dd5d","observation_id":"7bd2b3da-79ff-48ac-a61c-90b4067dbe94","resolution":{"observed_at":"2026-07-31T17:08:14.342198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.424249Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.424249Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:f7c2b1567e1d1edd9557be9336ea8d0a28d805422af0733448498e76295b9e41","observation_id":"144e5950-b87e-45b4-a18e-60da0f12560b","resolution":{"observed_at":"2026-07-31T17:08:14.424249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.509114Z","title":"Proceedings of the 40th International Conference on Machine Learning , series=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.509114Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:ae08d3ef3147db33c2abce1317919952374bfd48e8731e83f27b0bac269f0be2","observation_id":"8d9897c8-ad29-4522-8164-13b2a29f91cc","resolution":{"observed_at":"2026-07-31T17:08:14.509114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-07-31T17:08:14.596738Z","title":"arXiv preprint arXiv:2310.04378 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.596738Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:9e3119157debcb72dd6eb88607491cc29923ae178f2761ebe61b26d74ef27bbb","observation_id":"eb67626c-c0a1-418e-803b-af9a605673a0","resolution":{"observed_at":"2026-07-31T17:08:14.596738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.680962Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.680962Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b2f9ff8d392b17c0d06b9e768d2874d00763ec6591ce7f29a085620fb3ff8963","observation_id":"7c976c26-3e15-4d27-b276-893a417851c9","resolution":{"observed_at":"2026-07-31T17:08:14.680962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.741481Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.741481Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:83271e105773aa76b2f9ce2a0261e0011b052ab0d7a8486ea05a85b5d891798e","observation_id":"690dacbe-11dd-4f70-9bc0-28aeeaff6d83","resolution":{"observed_at":"2026-07-31T17:08:14.741481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.821993Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.821993Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3b16181313169571ebb1e632f3c8313cdb16daa16660beda36e89d4fe398d589","observation_id":"1343a015-fd23-47ec-8711-1cbc8cbb3b92","resolution":{"observed_at":"2026-07-31T17:08:14.821993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.880544Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.880544Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:74b4613580e7ae23089df94515bdb1e52080608a2f04d0083eef4794d34ed92a","observation_id":"ca1084b3-ff90-4ad8-8adb-b55ebd6bbdd3","resolution":{"observed_at":"2026-07-31T17:08:14.880544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:14.963647Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:14.963647Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:10ebcfef3ec71603e02bd96305c33c885727facb48d7a1a8e1c61041a960e916","observation_id":"a3018570-8433-4bce-8989-3c63211d1119","resolution":{"observed_at":"2026-07-31T17:08:14.963647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.045244Z","title":"2018 , url=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.045244Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b2b866be8517289fa5149858fb8bbb26fa9da294cc293f919ae6cedb833a5040","observation_id":"c7a00014-e39d-4c2f-a878-58ded9c74916","resolution":{"observed_at":"2026-07-31T17:08:15.045244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.051983Z","title":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.051983Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:4cefa0f106ed29ce4a6fd056a54ba2ac2594ab2df1877c2047400def2e7892c7","observation_id":"57b36782-c065-43ec-aa86-0cac472cbf17","resolution":{"observed_at":"2026-07-31T17:08:15.051983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.126294Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.126294Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:92f0f518c4ef7b90406846532d8bd30c9f3d81b4f2e8a2c5348f43a6c19106a2","observation_id":"126236ac-f585-4b08-87ab-9165ebd3f312","resolution":{"observed_at":"2026-07-31T17:08:15.126294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.296373Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.296373Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:59867654db8e66215fb5383bc796929321bb6ed4df4de26f1941bc3170bb3d69","observation_id":"27ca6f38-980b-41ea-9b81-031a3d08c3ca","resolution":{"observed_at":"2026-07-31T17:08:15.296373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.470436Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.470436Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:8245af738210593547e72eebd478dd5c8bbed8d55fa2ecc456a59d9667a13abc","observation_id":"ae2c9f48-d9a2-4587-89c4-cea2bb39d13b","resolution":{"observed_at":"2026-07-31T17:08:15.470436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.632658Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.632658Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:dd680068b6c531b9a7e5759ee7612fe490b9cd1152cf30b17d155509755213df","observation_id":"4e275b8f-566a-4566-aeda-d03f282d5ab7","resolution":{"observed_at":"2026-07-31T17:08:15.632658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-07-31T17:08:15.798786Z","title":"arXiv preprint arXiv:2310.01889 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.798786Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:e3a0d13c07c07b58725c93b7c41546828127e202e62a4774df8921850b7874c6","observation_id":"679e0143-930d-42af-ae53-48ae8e64d630","resolution":{"observed_at":"2026-07-31T17:08:15.798786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-07-31T17:08:15.803792Z","title":"arXiv preprint arXiv:1812.01717 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.803792Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:e75014ac487e3c246753e4d77b0f2fb00075f9266dbfc0de915dd3252169ca8d","observation_id":"7d8b6468-93a5-4073-8721-990364af2bc5","resolution":{"observed_at":"2026-07-31T17:08:15.803792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.806560Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.806560Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:88c6c089647c6e303df1d9d5b8b26f80f3c08e8ab699244b9172524b50d31f38","observation_id":"3498c81d-ea39-4a93-bd02-49db8125f97c","resolution":{"observed_at":"2026-07-31T17:08:15.806560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.809097Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.809097Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:632415f8e18c056745eb67765a779ad612f33ac5512537f6a3ce5cc74a399682","observation_id":"1a9f2e27-50fd-40bd-ad5b-1d803036c75d","resolution":{"observed_at":"2026-07-31T17:08:15.809097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06724","last_updated":"2019-07-15T20:08:17Z","snapshot_observed_at":"2026-08-10T08:23:33.792035Z","submitted_at":"2019-07-15T20:08:17Z","title":"Real-time Facial Surface Geometry from Monocular Video on Mobile GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06724","snapshot_observed_at":"2026-07-31T17:08:15.811386Z","title":"arXiv preprint arXiv:1907.06724 , year=","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.811386Z"},"links":{"cited_paper":"/paper/1907.06724","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:d472e5aee404326be96eef5da22aafd6a6c66ba4f294eceee84922ba067d1e0b","observation_id":"381e3dc6-3c85-4861-afac-6bf6b0756bf0","resolution":{"observed_at":"2026-07-31T17:08:15.811386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.814026Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.814026Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:55e05880bb69488f36bdd5fc87ae897e6c5056511d9981699710e43e81238210","observation_id":"66529383-4eb3-49e0-98a5-5ed356a12adb","resolution":{"observed_at":"2026-07-31T17:08:15.814026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.816286Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.816286Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:65b0af9223d1d7fbea1d07a3043f44b68cf78df830239dc04655f08166810b46","observation_id":"8bf23275-8562-4f37-b44a-704dff076131","resolution":{"observed_at":"2026-07-31T17:08:15.816286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.818631Z","title":"Anchor Forcing: Anchor Memory and Tri-Region","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.818631Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:eb868413c1138b0f15191d55a6146bf60209e2d872e52aa3af03e40201e49a13","observation_id":"5958e10a-93b3-4025-84da-18989545bd0a","resolution":{"observed_at":"2026-07-31T17:08:15.818631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.820913Z","title":"arXiv preprint arXiv:2603.14331 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.820913Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:832bc742aa2822a9b3b68c0b7f0b7013f13c2495a3c008ce946bfba34e3886ae","observation_id":"c5dc2ddf-4e66-4419-bb6f-50b471870349","resolution":{"observed_at":"2026-07-31T17:08:15.820913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30519","last_updated":"2026-05-28T19:56:00Z","snapshot_observed_at":"2026-08-13T01:14:56.419594Z","submitted_at":"2026-05-28T19:56:00Z","title":"OmniMem: Scalable and Adaptive Memory Retrieval for Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30519","snapshot_observed_at":"2026-07-31T17:08:15.823252Z","title":"arXiv preprint arXiv:2605.30519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.823252Z"},"links":{"cited_paper":"/paper/2605.30519","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:0b11b5f3dcf7f1dc2eddc063692e525eef9a364b97e68f103e9bae3cf507cae2","observation_id":"16d20e1f-deb0-4ab5-9602-c3b6afa144e9","resolution":{"observed_at":"2026-07-31T17:08:15.823252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10671","last_updated":"2026-08-04T12:43:00Z","snapshot_observed_at":"2026-08-07T23:11:38.667750Z","submitted_at":"2026-06-09T10:22:18Z","title":"FadeMem: Distance-Aware Memory Consolidation for Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10671","snapshot_observed_at":"2026-07-31T17:08:15.825740Z","title":"arXiv preprint arXiv:2606.10671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.825740Z"},"links":{"cited_paper":"/paper/2606.10671","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:3e4b1c2e4d74ed913bc6f48519a2fc766ae7e2c393ff13b3cd73c98c1b9e2367","observation_id":"12dd4093-823b-43ec-9e72-9d362424d486","resolution":{"observed_at":"2026-07-31T17:08:15.825740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T17:08:15.828466Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:15.828466Z"},"links":{"citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:a32140a1a2e8dac4a3551e982e1e97de5d577ab8b1350195c08baa95ae3b1b5b","observation_id":"a1388ee4-e28b-40d2-a660-caa4d477d91d","resolution":{"observed_at":"2026-07-31T17:08:15.828466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T04:25:21.046553Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":76,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2607.24359."}