{"as_of":"2026-08-08T20:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bc9cb64e3e05658e47333693add36833aaf7d4500c04f927e8b009e9532b83b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:28.063276Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:00:08.897097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T14:02:28.063276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:28.063276Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.20156"},"observation_digest":"sha256:d65d0fcba3bec17924bcb757d721d299dbbcce996d5a95858f93d42664f61612","observation_id":"3dc06998-993a-4eb3-a842-9d38f9c56de3","resolution":{"observed_at":"2026-08-07T14:02:28.063276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T13:21:50.439323Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22141","last_updated":"2025-08-27T16:33:34Z","snapshot_observed_at":"2026-08-07T20:49:32.346427Z","submitted_at":"2025-05-28T09:04:00Z","title":"FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:50.439323Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.22141"},"observation_digest":"sha256:a99e72d711868acbaddaa13ec47abeaa37553874a364d3527e377d21014b10c3","observation_id":"6d5318d3-3ad3-475b-b661-651c328cf821","resolution":{"observed_at":"2026-08-07T13:21:50.439323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T13:08:16.418579Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22581","last_updated":"2025-05-28T16:54:36Z","snapshot_observed_at":"2026-08-08T07:07:56.863758Z","submitted_at":"2025-05-28T16:54:36Z","title":"Tell me Habibi, is it Real or Fake?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:08:16.418579Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.22581"},"observation_digest":"sha256:bfd374e32510a7f2782baa17eb99fb379af093c5edbe03773dde1e2cc10884c8","observation_id":"25a467ec-ec17-40e7-ac56-bac851d42768","resolution":{"observed_at":"2026-08-07T13:08:16.418579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T13:07:31.880403Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:31.880403Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:8a704a06f9619e359890ad8935a80b841fbfd7497bb40cd5a3f6239dcf903b0d","observation_id":"8f6b2128-93cc-4554-990d-7c199ea931a3","resolution":{"observed_at":"2026-08-07T13:07:31.880403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:52:38.729151Z","title":"LatentSync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-07T21:00:17.781491Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.729151Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:9214292fef8dadb857f1dbc3bc55b001e7117fc250933efcae6005afe9a3be1a","observation_id":"debc9947-c133-4e07-925c-1c298f9f9325","resolution":{"observed_at":"2026-08-07T12:52:38.729151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:01:06.693590Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.693590Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ca2a9e9f163808006da41b609f2ce4897fa0622d008659811a82b8fda98335e1","observation_id":"b0ba2e37-e88a-4c9f-adc8-9341d5a5b77a","resolution":{"observed_at":"2026-08-07T12:01:06.693590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T22:18:36.238846Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22044","last_updated":"2025-06-27T09:42:30Z","snapshot_observed_at":"2026-08-08T12:31:13.741647Z","submitted_at":"2025-06-27T09:42:30Z","title":"Few-Shot Identity Adaptation for 3D Talking Heads via Global Gaussian Field","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:18:36.238846Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2506.22044"},"observation_digest":"sha256:56d53c934d5c39eca60ce1d2056644846ed79f73d432a6896b138328eb4b69e2","observation_id":"c715a38c-050e-4fbb-bbef-28d315edf4b3","resolution":{"observed_at":"2026-08-06T22:18:36.238846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T17:49:44.539951Z","title":"Latentsync: Au- dio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09862","last_updated":"2025-07-14T02:22:47Z","snapshot_observed_at":"2026-08-06T17:43:06.615236Z","submitted_at":"2025-07-14T02:22:47Z","title":"SpeakerVid-5M: A Large-Scale High-Quality Dataset for Audio-Visual Dyadic Interactive Human Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:49:44.539951Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.09862"},"observation_digest":"sha256:3a94bd1c0a146c2bd8c271540b3349f0e0f24a316892d563d12c98ed249bfbd6","observation_id":"83ee4b8f-4462-4a06-8221-881b3f7bab07","resolution":{"observed_at":"2026-08-06T17:49:44.539951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T13:39:30.957571Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.957571Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:04a2557a9798de0d037967e89668730d332eea5dbdf6fb796275df3498f3790a","observation_id":"3299ad7a-593c-4076-8a1e-68af829e8e84","resolution":{"observed_at":"2026-08-06T13:39:30.957571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T13:07:28.356402Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-08T08:14:38.727576Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.356402Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:25f1c0d2abffa44259cfa45cdb8411a115ae0295b7752eb495b37bd678a30df1","observation_id":"00912a17-7a4f-48c1-b26c-328ee3e8e517","resolution":{"observed_at":"2026-08-06T13:07:28.356402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T12:43:27.004117Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.004117Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6c561fd0180335ac26270c3df597706030e425be4bc048bab80d32f1598ca21b","observation_id":"74c75899-b98c-4529-acdf-2cdec7496d4e","resolution":{"observed_at":"2026-08-06T12:43:27.004117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-05T22:17:25.451010Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07337","last_updated":"2025-08-10T13:29:08Z","snapshot_observed_at":"2026-08-07T04:57:49.820822Z","submitted_at":"2025-08-10T13:29:08Z","title":"KLASSify to Verify: Audio-Visual Deepfake Detection Using SSL-based Audio and Handcrafted Visual Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:25.451010Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.07337"},"observation_digest":"sha256:58ab7fe0deb765c1a127f1f930977545e3404a33ada27dc7acc766f1fed89c7a","observation_id":"cc0a9d86-07da-450b-8e5f-dadf9baa51c7","resolution":{"observed_at":"2026-08-05T22:17:25.451010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-05T21:24:07.088948Z","title":"Latentsync: Au- dio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.088948Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:dfe33f4ae2c468d1b9812d7a23660816f154b873119fb29f4ed4be964859da86","observation_id":"98cb3211-2ac2-4a1d-8998-c10475b07b4b","resolution":{"observed_at":"2026-08-05T21:24:07.088948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-04T20:35:30.300454Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-07T20:58:14.689758Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.300454Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:1154814dae0130e789cc42841675075829995887ac6ef43725143140e0904ad4","observation_id":"d05a74d5-491e-44ba-a394-a08056f9ec64","resolution":{"observed_at":"2026-08-04T20:35:30.300454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2509.12052","last_updated":"2026-04-20T18:20:15Z","snapshot_observed_at":"2026-07-06T22:29:58.066459Z","submitted_at":"2025-09-15T15:34:02Z","title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T16:42:25.803856Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2509.12052"},"observation_digest":"sha256:4e79016fbc3013856cce7c581fb20fbe91308379cf842158df0e75f15cf7fc3e","observation_id":"1f3b08c1-4086-4b5a-8eeb-27cbd095b5eb","resolution":{"observed_at":"2026-05-18T16:42:43.761017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:03:45.576961Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2512.09299"},"observation_digest":"sha256:efbca89215aabdce9bc98d0f8f62893dc51758790d7c527f8abbda81436fd901","observation_id":"6908a6ef-8bc8-42dc-a0a4-00a894cc7380","resolution":{"observed_at":"2026-05-17T00:08:43.906132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-08-07T23:58:58.734836Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:ce3fa5686fc2902b8536d3eb8a8ce76744a89d0a354a3ec5447fb8d1d430e6a1","observation_id":"f7cea04d-1d7f-4e32-9df1-4834923b62fb","resolution":{"observed_at":"2026-05-16T09:57:42.868153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:5fae0ff2aab28726f88934c79634b9291407fbebea431c7cd5022ece5ce42211","observation_id":"780a3ad4-6c1a-4a8f-8948-4ae0dfe47615","resolution":{"observed_at":"2026-05-16T05:50:40.231763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:36.462567Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:91ae5688f0f3936ea4cff6fb99bba0d8703fb80534cbe42e67c78992620fab70","observation_id":"b52718a8-98bc-46eb-bcf3-03064ad6fbcd","resolution":{"observed_at":"2026-05-11T06:41:26.416919Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-02T16:38:16.186277Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T16:38:16.186277Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:54a04ee977e554a367c00788fda944dce211dff4217b66c2987487ddf6fb50c4","observation_id":"694d232e-16fa-45a8-ab94-991effd7ded5","resolution":{"observed_at":"2026-08-02T16:38:16.186277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.10542","last_updated":"2026-04-12T09:11:55Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T09:11:55Z","title":"VidAudio-Bench: Benchmarking V2A and VT2A Generation across Four Audio Categories","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T16:02:52.748220Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.10542"},"observation_digest":"sha256:757f18e3369905b123535c16847afd5b5c900312a76475dc88e1e80da4232076","observation_id":"e6d72828-02ca-4346-ab34-c154aa4cb845","resolution":{"observed_at":"2026-05-11T09:25:59.792719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":1},"reference_index":139,"source":"pdf_text","source_observed_at":"2026-05-10T16:36:33.264166Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:a422b714038921c56073496780860157db2d28bf3104cb4d07a4bb948136a3f2","observation_id":"0a54d19d-e869-419e-84dd-7f4ccf001c18","resolution":{"observed_at":"2026-05-11T08:30:56.873735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-12T22:04:31.302192Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.11283","last_updated":"2026-06-01T08:50:38Z","snapshot_observed_at":"2026-08-02T05:26:21.584719Z","submitted_at":"2026-04-13T10:42:31Z","title":"Multimodal Large Language Model-Enabled Video Translation: A Role-Oriented Survey","version":2},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-07-12T22:04:31.302192Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.11283"},"observation_digest":"sha256:c6ea2b3d395e5486e610455b7b6dcd5e2221cd2423862c2d21cebdda2c7e638c","observation_id":"613aac01-8192-4500-9d0b-92c38aafc4fe","resolution":{"observed_at":"2026-07-12T22:04:31.302192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:5d34c603405ab25f8a60a8e24e1d111114521350d9680f4030be414d05e1a564","observation_id":"aedb031d-19e2-402c-90cd-b707372eda83","resolution":{"observed_at":"2026-05-11T11:11:00.648558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:565287223a8539dcf0277b83bbe238a49f5ccd1e76fed19a24883b9447889229","observation_id":"32d1c15a-d768-428a-be0a-a7e728c9d695","resolution":{"observed_at":"2026-05-11T21:06:12.845345Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.10334","last_updated":"2026-05-11T10:35:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T10:35:39Z","title":"The Alpha Blending Hypothesis: Compositing Shortcut in Deepfake Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:09:25.765885Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.10334"},"observation_digest":"sha256:095393ca5abc68703971a64ac8b4dd8d3418006c0b5410011333b3d5ca4b7c72","observation_id":"39b2e213-19f9-4583-a441-53f7fb42d9b9","resolution":{"observed_at":"2026-05-12T05:31:26.015581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.16918","last_updated":"2026-05-16T10:20:52Z","snapshot_observed_at":"2026-07-06T23:28:02.429673Z","submitted_at":"2026-05-16T10:20:52Z","title":"HighSync: High-Quality Lip Synchronization via Latent Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T21:14:25.606097Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.16918"},"observation_digest":"sha256:eff33100f17e00acb6763a0e7310b37c1874722de13a4345b1ac3711a8d85f8f","observation_id":"72cd6e14-1968-44c6-917e-87c1370aecd7","resolution":{"observed_at":"2026-05-19T21:17:48.644948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:17:11.690484Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:61efa591dda0c62facac930c4155852558f546bbac3677efaad9afbdb7d8ef1d","observation_id":"76d3b99f-c78b-4afd-924c-38baa46d6614","resolution":{"observed_at":"2026-05-20T05:18:03.092717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.20183","last_updated":"2026-06-24T10:59:42Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:59:33Z","title":"MSAVBench: Towards Comprehensive and Reliable Evaluation of Multi-Shot Audio-Video Generation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T18:00:39.556424Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.20183"},"observation_digest":"sha256:35fdd655d416a944dfe51e57d1542fd25b9f28a0ab3ccd6afcbc5672b6b596ee","observation_id":"7405bc37-39ad-4398-a4d2-37075cefa508","resolution":{"observed_at":"2026-06-30T18:04:58.047082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-05T06:28:41.139206Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:a17b783c1cf455d9dd92a164f84878b2e04c0fda360524d272864d6cc6026323","observation_id":"b9fa4640-186b-4f4d-bf0e-6044e4b3a10b","resolution":{"observed_at":"2026-06-30T13:44:41.258619Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.28056","last_updated":"2026-05-27T07:02:31Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T07:02:31Z","title":"CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T13:03:27.312548Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.28056"},"observation_digest":"sha256:c11a675e7b26afb2278981d58417c3d211d2becba8c571fda256b37a55fe7d77","observation_id":"b76dc624-b739-4e2f-8ace-96b10a16d700","resolution":{"observed_at":"2026-06-29T13:13:27.640883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-04T00:25:45.398421Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:c9aa97485444250e0abb7790ce835cdcf9aa47463eb95a4128f26d5e29f203fc","observation_id":"87a6e748-6fea-43b1-9e31-d89be474d3d0","resolution":{"observed_at":"2026-06-29T07:53:13.366600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.03168","last_updated":"2026-06-02T05:26:06Z","snapshot_observed_at":"2026-08-02T13:13:11.403285Z","submitted_at":"2026-06-02T05:26:06Z","title":"JAVEDIT: Joint Audio-Visual Instruction-Guided Video Editing with Agentic Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T11:04:49.366127Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.03168"},"observation_digest":"sha256:63d76419b9ef711eda56a642c451f354bbef8dce0e70cea8dd66f0d7343571f5","observation_id":"ec41fd86-9262-41f2-9019-b5c3cabf12bd","resolution":{"observed_at":"2026-07-02T02:16:26.791937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.11180","last_updated":"2026-06-09T17:56:36Z","snapshot_observed_at":"2026-08-05T12:57:25.376491Z","submitted_at":"2026-06-09T17:56:36Z","title":"Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T13:40:14.506288Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.11180"},"observation_digest":"sha256:f7775216191f9fe31d49014380e307486d21a38c50791a0f51ae9e12926e7c48","observation_id":"ec70daa9-b274-470f-81d4-696047631ce6","resolution":{"observed_at":"2026-07-03T04:47:38.060385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.22772","last_updated":"2026-06-22T02:19:39Z","snapshot_observed_at":"2026-08-02T05:35:24.946640Z","submitted_at":"2026-06-22T02:19:39Z","title":"LoCC: Detection and Localization of Lip-Syncing Deepfakes via Counterfactual Frame Consistency","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T09:07:01.055433Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.22772"},"observation_digest":"sha256:083258624f032405b497aa54a14bfc6bc0820cd5fa2d168c7ecdf0721c115b2f","observation_id":"7bfb86b2-4ce7-46c3-85e5-9d4dc0583295","resolution":{"observed_at":"2026-07-04T10:09:44.847501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-02T05:18:16.697250Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-25T19:20:45.217627Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:6e2fe276bcc2167e445b8592aa17e1428074772fee0069db121aad37d35ed4ce","observation_id":"c651a21a-f11a-46e8-8d74-6b9e8a27f3b9","resolution":{"observed_at":"2026-07-04T21:00:08.898830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-12T12:05:10.800662Z","title":"arXiv preprint arXiv:2412.09262 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26092","last_updated":"2026-07-03T12:28:57Z","snapshot_observed_at":"2026-08-02T05:18:16.697250Z","submitted_at":"2026-06-24T17:59:06Z","title":"TryOnCrafter: Unleashing Camera Trajectories for Realistic Video Virtual Try-on via a Renderable 4D Try-on Proxy","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T12:05:10.800662Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.26092"},"observation_digest":"sha256:2004b218985666401ee5a82944d0eb551d16dbff5f3808cc975e9363dc4426e0","observation_id":"2d0af01d-0e94-48c4-9ed9-3be737f5dac0","resolution":{"observed_at":"2026-07-12T12:05:10.800662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":"2412.09262","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-04T21:00:08.897097Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision","venue":null,"work_id":"58bec219-b581-4884-a7c0-51325341150e","year":2024},"citing_paper":{"arxiv_id":"2606.27779","last_updated":"2026-06-26T07:11:10Z","snapshot_observed_at":"2026-08-07T20:53:29.333353Z","submitted_at":"2026-06-26T07:11:10Z","title":"MindFlow: Harmonizing Cognitive Semantics and Acoustic Dynamics for Facial Animation Generation in Dyadic Conversations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T05:04:31.366845Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2606.27779"},"observation_digest":"sha256:6c25e26ad86a7f220a74d58c974e901b60490b837eb954b56666d2ea566d5871","observation_id":"053ec822-aca2-4d00-bbfe-f5d7e8e4a668","resolution":{"observed_at":"2026-06-29T18:33:51.212770Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2412.09262 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:2710281fc70638189833b360ec32e2614a0141a899e739d79c8fc6e69de81685","observation_id":"a55db7b3-04b5-4057-a81b-560e4ef632c3","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-02T03:12:35.343990Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14189","last_updated":"2026-07-15T16:02:45Z","snapshot_observed_at":"2026-08-08T02:21:53.851123Z","submitted_at":"2026-07-15T16:02:45Z","title":"MultiRef-Compass: Towards Comprehensive Evaluation of Multi-Reference-to-Audio-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:12:35.343990Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2607.14189"},"observation_digest":"sha256:e812d59635634d7c40d3f61789ff8230420a43139724994f3c540f52da5bd674","observation_id":"1a10faba-ffcd-4946-bc5a-5c7f84600063","resolution":{"observed_at":"2026-08-02T03:12:35.343990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.09262/citation-record","integrity":"/paper/2412.09262/integrity","json":"/paper/2412.09262/citation-record.json","paper":"/paper/2412.09262"},"outbound":[],"paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2412.09262."}