{"as_of":"2026-08-12T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f3b92725fece6efac4293335f72b479638c59236f4a95aae5919db9aabff083","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:19:37.295188Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T06:13:11.504526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T09:45:40.337791Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-08-11T06:36:50.773707Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:a795c8287f0fa6212fe874115354575d1b2666afa1298bcb2d058a3b75f7a55c","observation_id":"8cc9086a-b1ed-47f3-9a91-3f6e7527df13","resolution":{"observed_at":"2026-05-16T22:08:36.256770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:cfcb935b96aefc38b6889974d56902a056b014f1666f7066131b9813c94fa79f","observation_id":"b2c3cf4f-83f6-44c6-af86-5a5b00ca820b","resolution":{"observed_at":"2026-05-15T22:20:22.355150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:6a7ad78a5f3c0adc90034ee49192fb05d55fa68b8e9fca6bbdae9e717c385f94","observation_id":"ea9b4d82-3dad-4742-a484-16aae52bc771","resolution":{"observed_at":"2026-05-12T10:36:29.794020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"cited_work":{"arxiv_id":"2508.20210","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.20210","snapshot_observed_at":"2026-07-01T09:45:40.337791Z","title":"Infinityhuman: Towards long-term audio-driven hu- man","venue":null,"work_id":"d3ad7bc4-da89-4874-962a-d7faa182afe6","year":2025},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2508.20210","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:9fb67873bb56aff622e8f9a9f0945e7c7556cb8b0aae6c28a04072fea9fa0de5","observation_id":"2200ada8-547f-435e-8314-93b52070d8c4","resolution":{"observed_at":"2026-07-01T09:45:40.339046Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.20210/citation-record","integrity":"/paper/2508.20210/integrity","json":"/paper/2508.20210/citation-record.json","paper":"/paper/2508.20210"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.050321Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.050321Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:0fea2dd60d0e541d0b927407b105dfecf4fd0a19400d83bb28f9673e0a07b5e5","observation_id":"cc0a63cf-7900-428f-a39b-d6c8e77fb643","resolution":{"observed_at":"2026-08-05T15:19:37.050321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.056293Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.056293Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:64abed3f72eb00786f12436ae27b892a96d3baae15cba7bc216d246b3affb995","observation_id":"6505ceef-5c88-4522-8425-d8ed5a63c410","resolution":{"observed_at":"2026-08-05T15:19:37.056293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-08-05T15:19:37.062536Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.062536Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:36f14e69918611b7c1307ce3de154901ef9559c44129c3c37f5ca32378e298ae","observation_id":"271442c1-62b2-4a68-aea6-e7ae265cbd28","resolution":{"observed_at":"2026-08-05T15:19:37.062536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-10T19:52:47.076746Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-05T15:19:37.068815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.068815Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:b52b648ff6cf26c8c6956f0f2906f93450014eed810d0f12d254d194adc225c3","observation_id":"36bc65c8-c9c2-4d2d-af15-bb7aad95c0f7","resolution":{"observed_at":"2026-08-05T15:19:37.068815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.243498Z","title":null,"venue":null,"work_id":"51a318af-8270-4869-93fb-b0920333f9cd","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.073887Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:65df313c345e45e41b96d8614d7d0534d1beacaf702da8711362fd2274b75709","observation_id":"0ed0deee-0350-4de7-94b2-808957e9e457","resolution":{"observed_at":"2026-08-05T15:19:38.248653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.227203Z","title":null,"venue":null,"work_id":"64d4a515-8f68-40e9-8058-1af332a1c22f","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.078799Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:8b0d78af58236e9ae1ad91bdf60632ff19277a7b0e74d0240cdc6369f2483b4f","observation_id":"23e80ff6-605b-4c51-b118-967cc6ce4aab","resolution":{"observed_at":"2026-08-05T15:19:38.231867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.210953Z","title":"E.; Fang, Y.; Lee, H.-Y.; Ren, J.; Yang, M.-H.; et al","venue":null,"work_id":"0be80c20-01fe-4e96-9457-a4b45bb983e6","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.083837Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:0cfe20a93d070728245c8f16a08e696b781e4e351409a0be0c695bd9f83316fa","observation_id":"6ba1d3e8-553d-4672-8be4-43b9c8007171","resolution":{"observed_at":"2026-08-05T15:19:38.215824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T15:19:37.088684Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.088684Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:666d08ef499ad1efa1782bd80f1d50a633eddbe6f456c1dbe8a695794056955c","observation_id":"69e9fe5b-c627-4661-b3b4-3e72b6611d20","resolution":{"observed_at":"2026-08-05T15:19:37.088684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.194942Z","title":null,"venue":null,"work_id":"233b7ef3-cd23-4386-a50d-fa8d4d74d1f4","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.094997Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:101fc3ffbdad0db47f1f601e1d1f55835738fdc8bdf30acbb18646fc47f43a95","observation_id":"af6ce6b3-4224-4969-821f-bcbbb626aca4","resolution":{"observed_at":"2026-08-05T15:19:38.199900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.178466Z","title":"S.; and Zisserman, A","venue":null,"work_id":"ce986abc-691b-451c-96e8-90da68ac46b4","year":2017},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.100643Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:376f16d349d53f61d9f7341f20f5f88317330a470b845d3aadb4c2a42060d275","observation_id":"038f89b7-c932-4c4b-8e8e-2c3d2d0df5ea","resolution":{"observed_at":"2026-08-05T15:19:38.183644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-12T05:01:49.188827Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T15:19:37.110895Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.110895Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:d43dcabea5347fca2cd3297002602b99c24f1cc03308546f749d6229ae2322d3","observation_id":"c85cec5c-d3de-468e-b6cd-8fe99dcf3647","resolution":{"observed_at":"2026-08-05T15:19:37.110895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-05T15:19:37.115944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.115944Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:a42a535fe0bfddb8ed14e136b22d9d6bbe98edf5b9bc6d7ef70a235afd2c061c","observation_id":"2a2ed21f-c783-4b36-8408-d28c9f114b26","resolution":{"observed_at":"2026-08-05T15:19:37.115944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-06T23:13:02.949681Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-05T15:19:37.120737Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.120737Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:87e2176aff7a4e0a98d61d177e3549188a7c7384cd4ccc0cdb58c72f74879008","observation_id":"fde95110-063c-4cbc-b40e-69b6b689c989","resolution":{"observed_at":"2026-08-05T15:19:37.120737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14773","last_updated":"2025-04-16T13:38:58Z","snapshot_observed_at":"2026-08-09T14:37:44.086189Z","submitted_at":"2024-03-21T18:27:29Z","title":"StreamingT2V: Consistent, Dynamic, and Extendable Long Video Generation from Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14773","snapshot_observed_at":"2026-08-05T15:19:37.125808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.125808Z"},"links":{"cited_paper":"/paper/2403.14773","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:82dbfccab7018435c412ee65abad4287ae74be39cb465d8b7c4142f6861b832d","observation_id":"be44d807-5be1-4d44-ab87-3bdd660a9c7b","resolution":{"observed_at":"2026-08-05T15:19:37.125808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.130452Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.130452Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7e04d12cbb83c871cab30fd258438ec3f35dd806730e17001e883a6bdc674491","observation_id":"5d6bbbce-33c5-4d1f-a207-93c7d5aa1711","resolution":{"observed_at":"2026-08-05T15:19:37.130452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T15:19:37.134859Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.134859Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:6cf1c6a9845bea03af45502c91369d8439ed14096ba0857ce458ad2ea786a245","observation_id":"74d7fde3-0a2b-426a-b704-d1d1e071aba8","resolution":{"observed_at":"2026-08-05T15:19:37.134859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.151329Z","title":null,"venue":null,"work_id":"13bca89c-8fc5-4dd2-968d-cff30a5eaefb","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.139672Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:0f9b1971d3249043f661090f4446e1816c18af47a548ce627927ad74e96058b5","observation_id":"2f00f6c6-edfe-4e6b-a774-de02a241b6e2","resolution":{"observed_at":"2026-08-05T15:19:38.156136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-10T23:27:53.135054Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-05T15:19:37.144059Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.144059Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:f7b454c148e69eee97b418bc09fcbec4cbb43c175f6086e882fa6502fe272125","observation_id":"16202775-438d-4101-9eef-a2e57bc02574","resolution":{"observed_at":"2026-08-05T15:19:37.144059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16771","last_updated":"2024-12-28T17:42:44Z","snapshot_observed_at":"2026-08-07T05:22:26.276397Z","submitted_at":"2024-04-25T17:23:43Z","title":"ConsistentID: Portrait Generation with Multimodal Fine-Grained Identity Preserving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16771","snapshot_observed_at":"2026-08-05T15:19:37.149071Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.149071Z"},"links":{"cited_paper":"/paper/2404.16771","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:9708696e80616a204c3bed3732ad50fd02fc996afc09ae2415320d74b266a317","observation_id":"8ef05fc4-daad-43b3-84d3-de7da141afac","resolution":{"observed_at":"2026-08-05T15:19:37.149071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T15:19:37.153799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.153799Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:1cf2d043fc3d5f952c5b264211a01c7a1ab585c4674bdb6d2c5365f4cf5213a7","observation_id":"146a4c50-26b6-4f83-a965-e321afbfb3c1","resolution":{"observed_at":"2026-08-05T15:19:37.153799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.134893Z","title":null,"venue":null,"work_id":"789eb2ed-5054-4168-912f-82182f0aa3e8","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.158574Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:fb9583d2bc53ea66d0e07205509d9cd289b4f281aed18edb32e32aba840716b0","observation_id":"469de640-625a-4dff-b7be-60a476dd0985","resolution":{"observed_at":"2026-08-05T15:19:38.140059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-08-10T18:19:52.749489Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-05T15:19:37.163455Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.163455Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:526421c6a8f4cb9d4d558320a51fda52cdcbbe942f963545baf310153175a88e","observation_id":"aefc38d3-8410-471e-ae5e-979f2c89fec7","resolution":{"observed_at":"2026-08-05T15:19:37.163455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T15:19:37.168237Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.168237Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:53fae6decc4c5aa64b1576da13ca87098b15b848eebfa7ae21518236975844c0","observation_id":"2b649be8-018a-4de3-b28b-05f9b18454b2","resolution":{"observed_at":"2026-08-05T15:19:37.168237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-09T18:52:43.975597Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-05T15:19:37.173088Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.173088Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:4d08d1ce0cc57c90aff47acf8f28f83835a48e43d8514ff3b23d510d36d6a9d5","observation_id":"3022cb00-cc3f-403b-b724-35d80d10d2ff","resolution":{"observed_at":"2026-08-05T15:19:37.173088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-10T13:26:51.589421Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T15:19:37.178523Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.178523Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:d4f249bb1bfc586fa67dc2bff3c6a2cedbe80d37222ad2ea61387f59b74d96eb","observation_id":"efb1e719-f16c-46fd-9d6d-61eceaba2a69","resolution":{"observed_at":"2026-08-05T15:19:37.178523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T15:19:37.183577Z","title":"T.; Ben-Hamu, H.; Nickel, M.; and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.183577Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:3125ec4c8681143033c0789b78c15f4bb7d142ced4501b6f3aec9ec969677893","observation_id":"20f435bd-b508-4dfa-addd-d92d80bb6b1a","resolution":{"observed_at":"2026-08-05T15:19:37.183577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.188569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.188569Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:b5bae8d0a86f210110bf320888dd874e1e9abb39a16e1aa547ffe2a44e13b798","observation_id":"202e6d05-139c-4a7a-b6a7-0f719cdf91d8","resolution":{"observed_at":"2026-08-05T15:19:37.188569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.119597Z","title":null,"venue":null,"work_id":"f9a29c5e-612b-4ccd-9ce2-50fd7fca1636","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.193017Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:1409b947ba737b4af20586fe3d01e3c750446a105f399bd2f927379087fdaef0","observation_id":"2718cb59-cc64-459f-b56e-103e47549e3a","resolution":{"observed_at":"2026-08-05T15:19:38.125171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-03T19:40:46.693368Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-05T15:19:37.197844Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.197844Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:2cd9f3f8e0863aff62541db5be9a4ddf67754d67be03aaaeb01ac5364e3ea087","observation_id":"d7d657ff-ebc3-4af5-8c10-adf6cf5f7986","resolution":{"observed_at":"2026-08-05T15:19:37.197844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.104933Z","title":null,"venue":null,"work_id":"073f6ea0-f803-4c5a-a53d-b0e204235b7f","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.203126Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:2094733180d55116ef0064c6c3ef7f5143573dd8ab61d1c6e89c08441591171b","observation_id":"97676dc0-2473-447e-b5e5-e0efa5e7aeac","resolution":{"observed_at":"2026-08-05T15:19:38.109624Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.088561Z","title":null,"venue":null,"work_id":"e967fd75-aafc-4f87-8882-0297f93fb4a1","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.209356Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:53d170dde57d599084e8d2e17243f68d58000e126513a5dfcddd0fafa562dca9","observation_id":"c1f3cd11-6ade-422c-b551-322c9f20e18a","resolution":{"observed_at":"2026-08-05T15:19:38.093372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T15:19:37.213971Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.213971Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:38dd8aea55016707f87e4ac32d12992ba55e1d7a930041c0ff78933c9be3d9be","observation_id":"d34993e8-472d-4343-8392-b985e2748253","resolution":{"observed_at":"2026-08-05T15:19:37.213971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-11T02:21:49.599854Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-05T15:19:37.223978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.223978Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:f67993355191ef732b7307bebf5884a0e5cf419280c54113084415b73b83217d","observation_id":"272fa9aa-e990-4612-add2-f17b4de8a0d7","resolution":{"observed_at":"2026-08-05T15:19:37.223978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-09T05:07:43.219616Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-05T15:19:37.229734Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.229734Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e4a702d09ad251623efab0864be601dda8b9fb5534525ef38e4b6a33efaa0ab1","observation_id":"d25195cc-2719-4df0-8b08-247ecd523f08","resolution":{"observed_at":"2026-08-05T15:19:37.229734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.071868Z","title":null,"venue":null,"work_id":"b07af98a-7fb3-488d-a254-013a7a24f0f2","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.234878Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:08f5eea6db4068773096c8b0c96e954268ea8062c8fc700f629d99e75c833046","observation_id":"62331e57-43f5-4b1b-a284-cc7be6a613b5","resolution":{"observed_at":"2026-08-05T15:19:38.077176Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-09T02:00:54.345290Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-05T15:19:37.239985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.239985Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:4a99612d1db3e094ef7be65434d49fdba68f72548dd61e7b1abdb14264b81829","observation_id":"5cf5dd96-bd4c-4fee-82a1-fe661de31133","resolution":{"observed_at":"2026-08-05T15:19:37.239985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T15:19:37.244894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.244894Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:7e01ca830b515cd790e693f64e0d588606bf249eca1cafc49a2264778c7fbcd4","observation_id":"2728a245-1ee2-4b8b-9c40-ab9ca16ade0a","resolution":{"observed_at":"2026-08-05T15:19:37.244894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-05T15:19:37.250325Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.250325Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:39f46a18bb66af9540c8a04f8d44843253d8c1dc84bc49af0d7fb73d515dbf6e","observation_id":"f037a761-4b70-49a6-82b6-336aaf4a3a45","resolution":{"observed_at":"2026-08-05T15:19:37.250325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.255149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.255149Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e21b2334312b398e5f2398b9c8666308b72669080513becbc9d3dcdf1e770817","observation_id":"38bb490f-c1fa-4a8d-83aa-6c91a5e74898","resolution":{"observed_at":"2026-08-05T15:19:37.255149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-10T18:20:34.522853Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T15:19:37.259854Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.259854Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:e0fc54812082c019ca0b3b58ae4a51bd2cc5b812b2c1079d5b204074e9953365","observation_id":"62b552ec-c597-4ea0-8810-5b3f829d2845","resolution":{"observed_at":"2026-08-05T15:19:37.259854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.056565Z","title":"T.; Durand, F.; Shechtman, E.; and Huang, X","venue":null,"work_id":"3053b631-1763-4a5c-b2e3-abae21c58c87","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.265364Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:131be268c2b1eebc5b10128403642da25b0df4be4a4bd7180c9331809d961531","observation_id":"bc0897b5-7993-4954-b38f-c6b837c17fcf","resolution":{"observed_at":"2026-08-05T15:19:38.061494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.039968Z","title":null,"venue":null,"work_id":"f4ac3850-c07c-442d-bb21-af1258a9d1b7","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.270656Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:20c57b893d650af43e72811247ea75c3c17bfdb06dc29142763bf2e740d11fd1","observation_id":"aa22d217-42a1-4175-86d8-d5c0af9172a9","resolution":{"observed_at":"2026-08-05T15:19:38.045258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.023566Z","title":null,"venue":null,"work_id":"35fb56d2-6aca-47b9-a7a4-f3224a36da0f","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.274971Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:43c28208ab357b5904c6a0c772286ffacb7aa9d55c591ee133013cd984d4154d","observation_id":"712e5916-70f3-47b7-ab08-bff605e41d50","resolution":{"observed_at":"2026-08-05T15:19:38.028130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:38.007768Z","title":null,"venue":null,"work_id":"d8b05f89-8384-457f-bbcf-105d23baaf10","year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.280329Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:bf242ec730d8072aad34cf2ce4d7d667425dccd14dfde308fc4944e4fa6d8406","observation_id":"5457650e-b5c7-4784-a037-f3279b68171a","resolution":{"observed_at":"2026-08-05T15:19:38.013438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.990814Z","title":null,"venue":null,"work_id":"316bed96-74d9-42d8-9628-ce94b121a33c","year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.285521Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:24eba3e80d86301964f72f728e365f4be4d6632862fe9e765d363841529a4e93","observation_id":"72e7c357-8f3a-4075-abd4-21cdf2c8c831","resolution":{"observed_at":"2026-08-05T15:19:37.995922Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.973192Z","title":null,"venue":null,"work_id":"6ceb6f9d-2820-474f-9592-228abb378d5d","year":2023},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.289764Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:bf07911fae926e9ec6db83f674be36a1ed3521e27d2436dc150af9a2c3724e02","observation_id":"5a86f957-c397-499e-a732-7b44102fb00f","resolution":{"observed_at":"2026-08-05T15:19:37.979057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:19:37.955006Z","title":null,"venue":null,"work_id":"e2412dbb-ba5e-4608-b70a-74b9b3755923","year":2021},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.295188Z"},"links":{"citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:a9fc07236a6c0156fb53c5d31b73e165a09e2e5fc1a7e1fc0180d9632d50fe4c","observation_id":"7ff90854-b684-44a0-9008-1925e1374859","resolution":{"observed_at":"2026-08-05T15:19:37.961578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T09:08:07.295323Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 4 inbound Pith citation observations for arXiv:2508.20210."}