{"as_of":"2026-08-10T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8207b689fc4bd319b18f4d35f33856da91854806adfa6cb933afb64fe5851726","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:52:42.261811Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23406/citation-record","integrity":"/paper/2505.23406/integrity","json":"/paper/2505.23406/citation-record.json","paper":"/paper/2505.23406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.442441Z","title":"What is the McGurk effect?Frontiers in psychology, 2014","venue":null,"work_id":"1008409c-b4a5-4985-88c8-e19c1641f92e","year":2014},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.356103Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:4f0c85ecc736e39eb1764b863a9381632936e58916dbe700ee5d3cb48febcad0","observation_id":"f1322c27-8c34-49bc-a3e2-d2277dc5e5a7","resolution":{"observed_at":"2026-08-07T12:52:47.550883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.401611Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.401611Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:db1eca6f7b28840449bae6c9953189bbecc688447b2300df6be16dbc6dd064d7","observation_id":"ed0023cb-ac21-4f26-ac0e-4f889831d3f4","resolution":{"observed_at":"2026-08-07T12:52:38.401611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:47.197388Z","title":"FlowVQTalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"f04a8900-992d-49eb-831b-21060a30cbe5","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.490225Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:53abab978b14a23234a50a034a6b62ad089ef3b42ca1da6ddcd17face928f33d","observation_id":"f4a2da30-0c30-432d-8fa3-26ccf99ee105","resolution":{"observed_at":"2026-08-07T12:52:47.291421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.875664Z","title":"Diffused heads: Diffusion models beat GANs on talking-face generation","venue":null,"work_id":"c8a02795-4e0d-42c4-aa80-e6835bd63dd4","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.572440Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:8652c63cacdb3098a3dca3edcee963efee636118f55cd1c14c5bb46589721789","observation_id":"63cc3d09-49a8-4724-a0a7-1ade0748da22","resolution":{"observed_at":"2026-08-07T12:52:46.993236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.584698Z","title":"EmoTalker: Emotionally editable talking face generation via diffusion model","venue":null,"work_id":"ccc02a71-d663-41fa-838f-af31209a7cbc","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.648541Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:e4566d383dc99c2a37566957668b6f484529139a3d97f38572341009455fde18","observation_id":"4ac0ba71-6774-4098-9cb0-0719da40383c","resolution":{"observed_at":"2026-08-07T12:52:46.749945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:52:38.729151Z","title":"LatentSync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.729151Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:cd935bd0edb5ada633267f9083740a62ce4c380cf34dbf61197d7085f09889a5","observation_id":"debc9947-c133-4e07-925c-1c298f9f9325","resolution":{"observed_at":"2026-08-07T12:52:38.729151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:38.796820Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.796820Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:de5c58aacc8bc6bd90b9eacd5cd7cabf03881f0edd30560cd840b5abcaa407db","observation_id":"2341ac32-84ad-4c94-8355-00b4dc29f8aa","resolution":{"observed_at":"2026-08-07T12:52:38.796820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:46.335247Z","title":"DiffDub: Person-generic visual dubbing using inpainting renderer with diffusion auto-encoder","venue":null,"work_id":"3d670a7b-823a-4a85-87de-94df742a3e9f","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.871905Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1fe47563bb3545522deacfb1b8e5e8ac20e4b18c167c1ddffa3e0d9c3c00ca72","observation_id":"62472101-44d6-426d-8f8d-a4f920a5d12c","resolution":{"observed_at":"2026-08-07T12:52:46.446086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T12:52:38.977281Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:38.977281Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:dab9a09fd79d0c80ca7dcda35fe921deb7f513d08f7cc43c6b3243214f43c787","observation_id":"4ff86e3d-b9b7-4194-ac1b-24242dff3043","resolution":{"observed_at":"2026-08-07T12:52:38.977281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.079791Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM transactions on audio, speech, and language processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.079791Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:9050cbec5a052562d610128f9fd13d8816696c483761823dedd337e2e628fb2d","observation_id":"3f4b7762-0bf8-4c58-ba33-bd1fda266a2a","resolution":{"observed_at":"2026-08-07T12:52:39.079791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.152209Z","title":"Video diffusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.152209Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:dc5c8c4bfc5194419be3555b88d99d7b9ffa0aaf925c4cb79c3ce676afa678e0","observation_id":"360c1290-b549-46de-9b16-2b5e828aab47","resolution":{"observed_at":"2026-08-07T12:52:39.152209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.233644Z","title":"Cascaded diffusion models for high fidelity image generation.Journal of Machine Learning Research, 23(47):1–33, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.233644Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:0ea2d06c999f92c7c16c4c24f51ae16017cf84b0aa2ef3a5fb51d45c503064d7","observation_id":"2f350542-197e-46a9-9c98-31c775b8c082","resolution":{"observed_at":"2026-08-07T12:52:39.233644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T12:52:39.322746Z","title":"V oxceleb2: Deep speaker recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.322746Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:a3290d5ce442b8f90bd1d61d8e6351f103eac080dd136cf29f87ee196a3806c3","observation_id":"32a4212f-fed6-45b3-b3a0-678263211f86","resolution":{"observed_at":"2026-08-07T12:52:39.322746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.390957Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.390957Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:cf4130669a758bb55435cc11fdfaf63a3bf0b16819ce61bebed7167f9cea1d62","observation_id":"4b42c7bd-5f60-4a3c-87e9-8465f7524021","resolution":{"observed_at":"2026-08-07T12:52:39.390957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.476990Z","title":"Analyzing and improving the image quality of stylegan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.476990Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:840b60ce0f9247532d82f673048fffccb5f3e9b20252a35c6a7fad8a43bde4c5","observation_id":"2a6f6325-ce77-4944-84fe-8795c8e8529e","resolution":{"observed_at":"2026-08-07T12:52:39.476990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.964849Z","title":"Diff2lip: Audio conditioned diffusion models for lip-synchronization","venue":null,"work_id":"53f90234-61c1-4805-9545-9b6531b90cc0","year":2024},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.554340Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1648321f33ed8eafa518d1227f3479fb21d285a7a90d51a9e0fc63be9cf6625a","observation_id":"717b0f2f-86bf-4bbe-b369-162ac42e22fc","resolution":{"observed_at":"2026-08-07T12:52:46.100966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.642421Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.642421Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:8ef29f4c108d8a4df64509ed75cc3cf118b3aa2d85987021d7ea606bb44db644","observation_id":"bdffe128-862e-4866-83fb-2843c342e7df","resolution":{"observed_at":"2026-08-07T12:52:39.642421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.774287Z","title":"The LJ speech dataset","venue":null,"work_id":"74a064ac-17a3-4e22-a165-33f6b9d7cdc7","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.753123Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:96fea64b2b70ef7c72713b846b581c15db29b66ac91f2b7ebc539af1638859e0","observation_id":"0e84d701-372d-474c-bd0e-be6047c1e44a","resolution":{"observed_at":"2026-08-07T12:52:45.860076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:39.866342Z","title":"Revise: Self-supervised speech resynthesis with visual input for universal and generalized speech regeneration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:39.866342Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:d2a40e08e7c357b14c3534128390c976bbbb68e76b3b8f48dae9d1e1a17ec995","observation_id":"db5ab34d-fcdc-4e82-9ce2-490e37096c24","resolution":{"observed_at":"2026-08-07T12:52:39.866342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.495451Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":"8f4d6bac-0bab-4e47-a5f9-a452e2c2e3bb","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.022633Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1b79b682d16ca54a02a7b8107203485d7f235890d81b0e2aac95b9202c1eafb2","observation_id":"8d80aae8-7e19-4490-b57a-40d50b5a339c","resolution":{"observed_at":"2026-08-07T12:52:45.627811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-07T12:52:40.178453Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.178453Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:b13d3c39058072703e7ff816355f29798f5f220011a147ddec79583d1e42424b","observation_id":"b25e0712-8975-4adc-9e60-0ef52efd1ae3","resolution":{"observed_at":"2026-08-07T12:52:40.178453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.238641Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.238641Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:04056236312b7ae47c836a26843efad5c08b4878f465300d5d2932f01e3d3064","observation_id":"874606e3-35a3-47dc-b410-a0c65bab477c","resolution":{"observed_at":"2026-08-07T12:52:40.238641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:45.270157Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"f22c3548-bd3c-4261-bdcb-ddd431b94316","year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.390336Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:b0270da895d20e44936ff1ac8058baa1ac492b45b7e62e485af15c82f3d7a6cd","observation_id":"0ee029bc-1821-43a2-ac95-1c28bb61c2e4","resolution":{"observed_at":"2026-08-07T12:52:45.322311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T12:52:40.473619Z","title":"LRS3-TED: A large-scale dataset for visual speech recognition.arXiv preprint arXiv:1809.00496, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.473619Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1abb4eff6ce7840705d3571ab5e290696b31431e4d04ce7a9b50dbaa01ff1114","observation_id":"731d8cc2-0dde-40e9-b0b1-095232f62973","resolution":{"observed_at":"2026-08-07T12:52:40.473619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.598243Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.598243Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:ba6fba2cffa80eb224d69f73458d65fb7e52d83a235777c368b08296f4af0679","observation_id":"58b33779-ec12-4693-b66e-9b28acc92859","resolution":{"observed_at":"2026-08-07T12:52:40.598243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.968454Z","title":"ModeFormer: Modality-preserving embed- ding for audio-video synchronization using transformers","venue":null,"work_id":"53fc9f44-2ede-417c-880a-f0a62ad8aec6","year":2023},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.747635Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:ce53bbb372cbd74cb985ce933581b079a489f71cff03ba0127b27fd636e0db58","observation_id":"1abfd6bf-0f26-4ee9-91b5-d4c1a43bcf23","resolution":{"observed_at":"2026-08-07T12:52:45.092809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:40.913842Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:40.913842Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:830e70746c5e2446a1fa4eb6332bf72d58b916a73b53533d5396e694418b2086","observation_id":"311cda32-899a-4641-84e7-9799e5818fac","resolution":{"observed_at":"2026-08-07T12:52:40.913842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.682526Z","title":null,"venue":null,"work_id":"5d667685-948a-4786-a42b-1d4f1ce3de7e","year":2016},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.044908Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:81c25a64ddba9048be32cf2be5b991a27cf406a247dadf20cdcb69819f24350f","observation_id":"8f242f5d-5fd3-4f4c-84e0-5c4e9edb49d1","resolution":{"observed_at":"2026-08-07T12:52:44.829616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.367555Z","title":"facenet-pytorch.https://github.com/timesler/facenet-pytorch, 2022","venue":null,"work_id":"d880c22f-3a7c-4bd7-afaf-87555848e48a","year":2022},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.157977Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:d772c26054451c27f493fa80e269d6e273735e6088197fc23bd8183711297af8","observation_id":"92283cca-4813-4ac7-89c6-c4da7cc42a43","resolution":{"observed_at":"2026-08-07T12:52:44.525468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:52:41.243738Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.243738Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:d202a60c143d1ecd586f770de104272a59fe1db45acd96a3761e8fd241765496","observation_id":"deca0c92-4cf2-45b3-a204-adf4f34899d0","resolution":{"observed_at":"2026-08-07T12:52:41.243738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:44.109216Z","title":"Wilcoxon signed-rank test.Encyclopedia of biostatistics, 8, 2005","venue":null,"work_id":"02c1cb15-e5b2-4a39-95a0-d2dfc195491e","year":2005},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.348488Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:952670fc789552ed4be5917f47d059a0ea6b5690d273922496de4ef82e6d8364","observation_id":"cf48b885-2584-432c-a059-a91b939fceba","resolution":{"observed_at":"2026-08-07T12:52:44.218176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.478411Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.478411Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:afda7304b1c83a373f693d75cafaf23253ac2d84683fbeff2b4f0af8deee3f4c","observation_id":"75cd4042-aefe-4483-a308-bbc18b1a57fb","resolution":{"observed_at":"2026-08-07T12:52:41.478411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.818829Z","title":"guided-diffusion.https://github.com/openai/guided-diffusion, 2021","venue":null,"work_id":"248aabfa-e417-4285-9f8e-b7bf53925e9e","year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.621165Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:1b3dd91a49f3dc59ef424964ceb95023582ac591145f6c2d8cdb90f07d7ef100","observation_id":"0549e04d-a162-4e05-9cd2-b88efe32227b","resolution":{"observed_at":"2026-08-07T12:52:43.947606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:41.739324Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.739324Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:4636804d567c500b1e2e65966364896e6f628951e46c70587a1e7a243234e9d0","observation_id":"98b48bc8-d009-440e-9268-119adc32404b","resolution":{"observed_at":"2026-08-07T12:52:41.739324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.510727Z","title":"ns\" represents non-significant results (p > 0.05),","venue":null,"work_id":"bccb3cbd-79a6-4632-ab46-672e19799bf3","year":2025},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.864758Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:a7c8b9962d7e6796a69b3fc53d02d6698291d4b67f7eb6d0401e9fb088a0eff0","observation_id":"6a5ee8b1-41f4-493e-a827-2337c89698a3","resolution":{"observed_at":"2026-08-07T12:52:43.666566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:43.299275Z","title":"We used a constant crop to ensure the corrupted video would not inadvertently synchronize with the audio","venue":null,"work_id":"116f7989-3c2a-40e7-bf0d-f0a67f554cd4","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:41.936299Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:4a51a737368c54e4798c7091eed7377198c7f01149eb5a2bd758f8c1b529e44b","observation_id":"d311c2f6-5179-49aa-9ab4-95197024e9fa","resolution":{"observed_at":"2026-08-07T12:52:43.377227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.910889Z","title":null,"venue":null,"work_id":"bece6a11-791e-4519-9092-c93ee8e1968e","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.078614Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:278ee51e513164765ec642c0dbd479429fcd85d376f2d2884ffa53fa444b0cd2","observation_id":"0610c022-b4a9-4a17-bb58-392008b77913","resolution":{"observed_at":"2026-08-07T12:52:43.080828Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:52:42.578156Z","title":"facebook/hubert-large-ll60k","venue":null,"work_id":"4ac6e7b2-8faf-4d7c-835a-14c2ca58dca0","year":null},"citing_paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:52:42.261811Z"},"links":{"citing_paper":"/paper/2505.23406"},"observation_digest":"sha256:69da55bb77586ac8d48b0ea3c5c782710cc06549a5c5694b82b0fcc2f85dba45","observation_id":"16d05ea2-2420-457f-8298-3e4e46f44ab5","resolution":{"observed_at":"2026-08-07T12:52:42.746809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23406","last_updated":"2025-05-29T12:56:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:09:20.577971Z","submitted_at":"2025-05-29T12:56:09Z","title":"Video Editing for Audio-Visual Dubbing"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2505.23406."}