{"as_of":"2026-08-09T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ad5439869e30305716437b3a139a7e8b410867e8efc08c41270593592e5948d1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:23:42.444845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:46:15.581615Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-09T18:16:40.933559Z","title":"Audio2head: Audio-driven one-shot talking-head generation with natural head motion.arXiv:2107.09293, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00654","last_updated":"2025-02-02T04:01:54Z","snapshot_observed_at":"2026-08-09T18:08:46.436025Z","submitted_at":"2025-02-02T04:01:54Z","title":"EmoTalkingGaussian: Continuous Emotion-conditioned Talking Head Synthesis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T18:16:40.933559Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2502.00654"},"observation_digest":"sha256:deb992e56770127e07cca4caab428e98520b47c93c9de8521ba3f45da4b3647e","observation_id":"cb04df4c-a84f-4ec1-93a3-b2fd16aa261e","resolution":{"observed_at":"2026-08-09T18:16:40.933559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-09T18:23:42.444845Z","title":"Audio2head: Audio-driven one-shot talking- head generation with natural head motion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06803","last_updated":"2025-02-02T00:11:19Z","snapshot_observed_at":"2026-08-09T18:19:06.768922Z","submitted_at":"2025-02-02T00:11:19Z","title":"Emotion Recognition and Generation: A Comprehensive Review of Face, Speech, and Text Modalities","version":1},"reference_index":153,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:42.444845Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2502.06803"},"observation_digest":"sha256:1fada8d9586d4444e8713d8c4be5cb54aef41c2df8e538f3471d4d33c2e826b2","observation_id":"c6111573-4bb5-4e1a-a5fb-e502009c9c16","resolution":{"observed_at":"2026-08-09T18:23:42.444845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-07T21:11:25.336787Z","title":"Audio2head: Audio-driven one-shot talking-head generation with nat- ural head motion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09533","last_updated":"2025-02-13T17:50:23Z","snapshot_observed_at":"2026-08-07T22:10:29.240376Z","submitted_at":"2025-02-13T17:50:23Z","title":"Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T21:11:25.336787Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2502.09533"},"observation_digest":"sha256:75f2f1eccb9812561de0e7554015cbcfd24163346caa3990d8c95ccd37da745e","observation_id":"4990ae01-00a6-440d-94d2-4aee3b75ffcb","resolution":{"observed_at":"2026-08-07T21:11:25.336787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-07T11:20:51.176183Z","title":"Audio2head: Audio-driven one-shot talking- head generation with natural head motion.arXiv preprint arXiv:2107.09293, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02875","last_updated":"2025-06-03T13:39:57Z","snapshot_observed_at":"2026-08-07T21:50:37.234501Z","submitted_at":"2025-06-03T13:39:57Z","title":"NTIRE 2025 XGC Quality Assessment Challenge: Methods and Results","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T11:20:51.176183Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2506.02875"},"observation_digest":"sha256:cc5343e7f216091d0a054454805a1d8742e808639b3846baab5e3247a72e7cdb","observation_id":"49565245-a006-4168-b27b-68b18c85b1c1","resolution":{"observed_at":"2026-08-07T11:20:51.176183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-07T00:15:44.518622Z","title":"Audio2head: Audio- driven one-shot talking-head generation with natural head motion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.14742","last_updated":"2025-06-17T17:22:12Z","snapshot_observed_at":"2026-08-07T20:51:47.320894Z","submitted_at":"2025-06-17T17:22:12Z","title":"SyncTalk++: High-Fidelity and Efficient Synchronized Talking Heads Synthesis Using Gaussian Splatting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:44.518622Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2506.14742"},"observation_digest":"sha256:4e45867506b494952092f6ad57b5bd5cfd4ddff8ffe746b36b98695510f7302e","observation_id":"5f3739da-5e95-40cc-ad27-7280efcb2de9","resolution":{"observed_at":"2026-08-07T00:15:44.518622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-06T10:53:19.120381Z","title":"Audio2head: Audio-driven one-shot talking- head generation with natural head motion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.23343","last_updated":"2025-07-31T08:43:21Z","snapshot_observed_at":"2026-08-08T04:06:08.932242Z","submitted_at":"2025-07-31T08:43:21Z","title":"Who is a Better Talker: Subjective and Objective Quality Assessment for AI-Generated Talking Heads","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:19.120381Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2507.23343"},"observation_digest":"sha256:1abbda4fffc3db1fbcdc5fad780c50129d3bea5c5babe5f4e00bff026222c8b1","observation_id":"b549b02b-96c3-43dc-8314-61caf0adf92d","resolution":{"observed_at":"2026-08-06T10:53:19.120381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":"2107.09293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-07-01T21:46:15.581615Z","title":"Audio2head: Audio-driven one- shot talking-head generation with natural head motion.arXiv preprint arXiv:2107.09293","venue":null,"work_id":"f4e38954-78e6-4ac2-9278-46075229c5b3","year":2021},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:036115328619ee62bdb116b4a6e2dd0e408a2aa463e10cd27ebf752be3bafaf7","observation_id":"1b9799a9-e6e2-4e32-af47-421865ccbb43","resolution":{"observed_at":"2026-05-16T05:50:40.246667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":"2107.09293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-07-01T21:46:15.581615Z","title":"Audio2head: Audio-driven one- shot talking-head generation with natural head motion.arXiv preprint arXiv:2107.09293","venue":null,"work_id":"f4e38954-78e6-4ac2-9278-46075229c5b3","year":2021},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:d484414629a840db135b02c08ff035e44f2f475f027b4999be73967ad2d8e240","observation_id":"707c910a-ce2d-4375-ba78-2e5ec50a3b58","resolution":{"observed_at":"2026-05-11T12:41:04.425900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":"2107.09293","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-07-01T21:46:15.581615Z","title":"Audio2head: Audio-driven one- shot talking-head generation with natural head motion.arXiv preprint arXiv:2107.09293","venue":null,"work_id":"f4e38954-78e6-4ac2-9278-46075229c5b3","year":2021},"citing_paper":{"arxiv_id":"2606.01031","last_updated":"2026-05-31T05:44:42Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:44:42Z","title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T16:19:55.048831Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2606.01031"},"observation_digest":"sha256:efab6495d4f6d3b2c88a55128f1892827581d621d177ca08a9b7770013d3a773","observation_id":"98ed7b23-2b3a-4cd5-9d47-00028f0b7d70","resolution":{"observed_at":"2026-07-01T21:46:15.583006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.09293","snapshot_observed_at":"2026-08-04T17:26:50.150881Z","title":"arXiv preprint arXiv:2107.09293 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01978","last_updated":"2026-08-03T09:41:59Z","snapshot_observed_at":"2026-08-07T15:34:09.476468Z","submitted_at":"2026-08-03T09:41:59Z","title":"Proxy Avatar Meets Low-Rank Caching: Real-Time One-Shot Emotion-Controllable Portrait Animation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T17:26:50.150881Z"},"links":{"cited_paper":"/paper/2107.09293","citing_paper":"/paper/2608.01978"},"observation_digest":"sha256:694587da307223438c16dd476682c75af00066c0aeaa83b37f3f3b6f6acd2757","observation_id":"dbf346d2-dc65-4f91-9949-97b7be03f722","resolution":{"observed_at":"2026-08-04T17:26:50.150881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2107.09293/citation-record","integrity":"/paper/2107.09293/integrity","json":"/paper/2107.09293/citation-record.json","paper":"/paper/2107.09293"},"outbound":[],"paper":{"arxiv_id":"2107.09293","last_updated":"2021-07-20T07:22:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T20:10:22.042475Z","submitted_at":"2021-07-20T07:22:42Z","title":"Audio2Head: Audio-driven One-shot Talking-head Generation with Natural Head Motion"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2107.09293."}