{"as_of":"2026-08-11T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11ea568780b088ae92299155322ad680d912af1cc0fb72dbf8b18d4c51b69110","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":11,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":11,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:32:26.313485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:47:38.037365Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-08-11T04:59:34.986282Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:1d91541087d7d47a8da37fad8c41d62703a60d3ff1b9aee863d3c66cfe12aa60","observation_id":"aff5c502-e45a-46f6-8ca0-34a01eb77b0b","resolution":{"observed_at":"2026-05-17T03:48:58.439681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2604.17211","last_updated":"2026-04-19T02:43:00Z","snapshot_observed_at":"2026-08-03T14:44:01.659679Z","submitted_at":"2026-04-19T02:43:00Z","title":"EmbodiedHead: Real-Time Listening and Speaking Avatar for Conversational Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T07:13:14.016037Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2604.17211"},"observation_digest":"sha256:ddefa859906af34b4e37f182353e0ab935c154fc7e4d0519153cdcc2d59bccc3","observation_id":"a61b82db-94ac-4902-bdaa-b89186533c04","resolution":{"observed_at":"2026-05-10T09:18:32.701727Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:0be482213874949b7ebf4b035fb2a473f5039821872d9515a12b7a7d1310710a","observation_id":"b8967c69-f332-4dc5-8517-e487b831e57a","resolution":{"observed_at":"2026-05-12T10:36:29.838171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-08-11T16:32:52.754940Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:af5db50ed72772a9a0b9a43105556bf204df793c99d1bdd6a698eeb9419ed2e0","observation_id":"57d2f305-9fe3-4d7a-bfb5-c781f9646639","resolution":{"observed_at":"2026-05-11T17:06:04.220395Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-11T12:02:27.560611Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:cb59b03f0588b755a298507a8c5bc14cfe645bfd9d26ae61302c48ee257c3a14","observation_id":"8f3c463c-7e35-4739-ae30-61409daab282","resolution":{"observed_at":"2026-05-11T03:45:57.373765Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.24176","last_updated":"2026-05-22T19:54:37Z","snapshot_observed_at":"2026-08-02T13:05:06.490316Z","submitted_at":"2026-05-22T19:54:37Z","title":"Loki: Representation over Architecture for Diffusion-Based Portrait Animation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T15:23:48.899214Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.24176"},"observation_digest":"sha256:07ce538f7aa964b6a7bd1b6c8f146531129de4e448fe8aa01da339f1d501e87f","observation_id":"80cd7ae3-9b44-4ac3-94bc-49f1ca17d1c4","resolution":{"observed_at":"2026-06-30T15:24:49.843928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:72f3e6b8442d09ed4dbc07474cbb3bd8c108e728273f54a6e5dff012a93da9df","observation_id":"6b01a8fd-5bb2-4d0f-a464-9b771debbcb7","resolution":{"observed_at":"2026-06-29T22:24:00.912836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2605.28056","last_updated":"2026-05-27T07:02:31Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T07:02:31Z","title":"CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:03:27.312548Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2605.28056"},"observation_digest":"sha256:3cc6f5839eb29b1d975a0919750306c4810d80db7daeb92cf8853c9938828320","observation_id":"da29839b-403c-4925-a329-2f9f826e875a","resolution":{"observed_at":"2026-06-29T13:13:27.691764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2606.03672","last_updated":"2026-06-02T13:56:31Z","snapshot_observed_at":"2026-08-06T22:12:01.138053Z","submitted_at":"2026-06-02T13:56:31Z","title":"Foley-Omni: A Unified Multimodal Generation Model from Task-Level Audio Synthesis to Complete Video Soundtrack Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-06-28T08:38:44.906160Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2606.03672"},"observation_digest":"sha256:b8bf3e05dc63f4d605b9efd97cc8ea6c5f1f8964aceeac20ef3fa1a304ee72ef","observation_id":"07d31efe-f448-4693-8484-ed62606324eb","resolution":{"observed_at":"2026-07-02T04:56:39.445907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":"2508.13618","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-07-03T04:47:38.037365Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis","venue":null,"work_id":"1f360192-695e-4d11-b015-5eb72a4cb7aa","year":2025},"citing_paper":{"arxiv_id":"2606.11180","last_updated":"2026-06-09T17:56:36Z","snapshot_observed_at":"2026-08-05T12:57:25.376491Z","submitted_at":"2026-06-09T17:56:36Z","title":"Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:40:14.506288Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2606.11180"},"observation_digest":"sha256:77f050aba02f11185addabe4d0a26ccb31e4bae94d0a90cd008aaa92bde2dd05","observation_id":"53b7fc41-61f6-4ec3-9328-2fed4d84fb54","resolution":{"observed_at":"2026-07-03T04:47:38.038924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13618","snapshot_observed_at":"2026-08-02T05:32:26.313485Z","title":"Talkvid: A large-scale diversified dataset for audio-driven talking head synthesis.arXiv preprint arXiv:2508.13618, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13336","last_updated":"2026-07-14T23:50:57Z","snapshot_observed_at":"2026-08-04T17:00:35.224060Z","submitted_at":"2026-07-14T23:50:57Z","title":"Delving into the Temporal Challenges of Unified Video Protection Against Image-to-Video and Fine-Tuning-based Customization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:32:26.313485Z"},"links":{"cited_paper":"/paper/2508.13618","citing_paper":"/paper/2607.13336"},"observation_digest":"sha256:feaec446b303e10c65f8d293211d0afd647cf482c6f44376ae6cb11decbcfdaa","observation_id":"5a1053a8-3470-49b4-8b6b-7998d5137aad","resolution":{"observed_at":"2026-08-02T05:32:26.313485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.13618/citation-record","integrity":"/paper/2508.13618/integrity","json":"/paper/2508.13618/citation-record.json","paper":"/paper/2508.13618"},"outbound":[],"paper":{"arxiv_id":"2508.13618","last_updated":"2025-08-19T08:31:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T14:03:11.013735Z","submitted_at":"2025-08-19T08:31:15Z","title":"TalkVid: A Large-Scale Diversified Dataset for Audio-Driven Talking Head Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 11 inbound Pith citation observations for arXiv:2508.13618."}