{"as_of":"2026-08-15T12:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:230532c66d177b24bfcdd9d81a417b195edf67f4ba28b961ab36c6c96de42054","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:19:53.157881Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00498/citation-record","integrity":"/paper/2507.00498/integrity","json":"/paper/2507.00498/citation-record.json","paper":"/paper/2507.00498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:51.147531Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.147531Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:ce5a2657c18483a5f1ce0bcaa158eaa8b240e18720cfd0ddc4884cc3eb4a5cce","observation_id":"9291ee37-5d5e-4583-9f71-c7208b032c31","resolution":{"observed_at":"2026-08-06T21:19:51.147531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:51.171962Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.171962Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:dc634580a06a4be5cbefd37a4fb3dd9e898890775d5dbb71fe55be2e6a0d7b3e","observation_id":"5706bf15-168a-4b5c-b8d3-606e51028c32","resolution":{"observed_at":"2026-08-06T21:19:51.171962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-14T18:33:50.882150Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T21:19:51.211857Z","title":"S.; and Zisserman, A","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.211857Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:4378a9bdee25b138042a02c9de88651578541563b2be0092d0229b66bf26d0bf","observation_id":"9d74eef3-79db-482a-95fc-45a46764d337","resolution":{"observed_at":"2026-08-06T21:19:51.211857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12013","last_updated":"2020-07-23T20:52:37Z","snapshot_observed_at":"2026-08-11T13:56:54.291391Z","submitted_at":"2020-06-22T05:36:16Z","title":"CLUB: A Contrastive Log-ratio Upper Bound of Mutual Information","version":6},"cited_work":{"arxiv_id":"2006.12013","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.12013","snapshot_observed_at":"2026-08-06T21:19:54.109893Z","title":"CLUB: A Contrastive Log-ratio Upper Bound of Mutual Information","venue":"cs.LG","work_id":"c4977d50-afd5-40fa-bb9e-af8603fcec96","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.301107Z"},"links":{"cited_paper":"/paper/2006.12013","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:f372443e319137be9f0aff70b2b405eb45031b224cdcf7c6fa8fb152d22ceb50","observation_id":"fe53fff1-4baf-44a5-878b-030fb9ff06e0","resolution":{"observed_at":"2026-08-06T21:19:54.154005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07787","last_updated":"2023-08-15T14:07:41Z","snapshot_observed_at":"2026-08-15T01:39:37.744592Z","submitted_at":"2023-08-15T14:07:41Z","title":"DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding","version":1},"cited_work":{"arxiv_id":"2308.07787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.07787","snapshot_observed_at":"2026-08-06T21:19:53.980375Z","title":"DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embedding","venue":"cs.SD","work_id":"af0c6edf-ef99-48cc-8ef9-37827478487b","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.343362Z"},"links":{"cited_paper":"/paper/2308.07787","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:d3ed6becea9c2c88ec05bf4bc3e7027e1a3f15b8dcd04590e7986065dd8e07f5","observation_id":"f1bd61be-3db6-4f8d-9f3e-756e67d0be9a","resolution":{"observed_at":"2026-08-06T21:19:54.028479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19603","last_updated":"2023-05-31T07:17:32Z","snapshot_observed_at":"2026-08-13T11:28:47.784750Z","submitted_at":"2023-05-31T07:17:32Z","title":"Intelligible Lip-to-Speech Synthesis with Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19603","snapshot_observed_at":"2026-08-06T21:19:51.402047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.402047Z"},"links":{"cited_paper":"/paper/2305.19603","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:3f984ae22fa9ac20e2f053b88374dcc8bb3739c967cfbec58d1b9b2065c952fb","observation_id":"d0dcf465-cbdc-4f90-8470-770e0df21ade","resolution":{"observed_at":"2026-08-06T21:19:51.402047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.795425Z","title":"S.; Nagrani, A.; and Zisserman, A","venue":null,"work_id":"3378d19c-cdaa-4615-88f7-c9b994d47253","year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.480178Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:61da45ee8b7614d82c9b4dd22e97a402f6ec50f85e6f255b418a5617040eaaff","observation_id":"cdd914df-a71d-42fe-a688-a570af45917b","resolution":{"observed_at":"2026-08-06T21:19:56.919670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T21:19:51.504954Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.504954Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:0e25b9bc0586e594a255c5868ae19ddfc816f271c0b599eb86fba02d6ccb8e50","observation_id":"9c492056-dde3-4364-b09b-f71204d78236","resolution":{"observed_at":"2026-08-06T21:19:51.504954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17002","last_updated":"2025-05-28T11:34:57Z","snapshot_observed_at":"2026-08-14T21:14:24.897006Z","submitted_at":"2025-05-22T17:57:55Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","version":2},"cited_work":{"arxiv_id":"2505.17002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17002","snapshot_observed_at":"2026-08-06T21:19:53.890089Z","title":"PAEFF: Precise Alignment and Enhanced Gated Feature Fusion for Face-Voice Association","venue":"cs.CV","work_id":"007a814b-b543-482a-ae7e-324570921cfb","year":2025},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.555712Z"},"links":{"cited_paper":"/paper/2505.17002","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:a2f17600c140a8ac9f5770d58af83d9f327339407d923706ab5d77178b3a6076","observation_id":"cd2426c6-f426-4597-933d-b22d65292576","resolution":{"observed_at":"2026-08-06T21:19:53.919077Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.597575Z","title":null,"venue":null,"work_id":"ecf40e9c-c53c-447b-9cdc-58ec2a329f23","year":2016},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.633979Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:5772684dcb3e881fd6ca660b43815003b5636f54335bef277a225c7b4aa90917","observation_id":"56aaea29-bba8-449d-a66d-fb3c40cdc900","resolution":{"observed_at":"2026-08-06T21:19:56.720531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.381326Z","title":null,"venue":null,"work_id":"f4b4114f-0429-4c75-b528-b663c5652bc0","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.670519Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:948fb788a9b5ae9eac0e2ce249c9203863d018669f7fbda52473f892bcf85982","observation_id":"3dd5f74d-27b0-4753-bda5-0a530fe82af2","resolution":{"observed_at":"2026-08-06T21:19:56.479759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.205900Z","title":null,"venue":null,"work_id":"cf5067d1-3e85-46ad-b5a0-71eeb7daf4de","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.730095Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:bed302b1a479759b616dddd51601314a3ccc0801c9243ff34dcf64e5b87b3dbe","observation_id":"72acfcf5-f43a-4759-97bd-069837665ac5","resolution":{"observed_at":"2026-08-06T21:19:56.294575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-06T21:19:51.800306Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.800306Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:260dc273a9c40b2f94a18df4c0db72a8795bcfc62ea7dbd37b4aa33cd5cd705e","observation_id":"ead1e5f4-0116-4f3a-9204-a73e4d863fef","resolution":{"observed_at":"2026-08-06T21:19:51.800306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:56.003595Z","title":null,"venue":null,"work_id":"5d96a83e-33f6-434d-a23c-43bece69bc73","year":2024},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.840171Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:d68256fa7eb133fe4f14eac39eaf93702a2e04538d2676b7900ce88e2e07598c","observation_id":"d44b3b0f-7301-4d36-8f68-2b9e7b233f15","resolution":{"observed_at":"2026-08-06T21:19:56.104956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.791392Z","title":null,"venue":null,"work_id":"55de2d78-095a-4135-8825-679222572703","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.901215Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:ee5eb52546839d7e0f10aba173def9894349249923cb85f8c418273a001ff044","observation_id":"56964d59-c821-4aad-80d6-d7417c6160e2","resolution":{"observed_at":"2026-08-06T21:19:55.887753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05223","last_updated":"2025-03-07T08:21:48Z","snapshot_observed_at":"2026-08-13T12:35:49.536860Z","submitted_at":"2025-03-07T08:21:48Z","title":"DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility","version":1},"cited_work":{"arxiv_id":"2503.05223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05223","snapshot_observed_at":"2026-08-06T21:19:53.763024Z","title":"DiVISe: Direct Visual-Input Speech Synthesis Preserving Speaker Characteristics And Intelligibility","venue":"cs.SD","work_id":"21d3b8e8-cb0d-40cb-8e12-eafee4ef5baf","year":2025},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:51.982678Z"},"links":{"cited_paper":"/paper/2503.05223","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:88e5c91962a2723cd50682acf2a51a4a1f56b7c484b69f0808f9482a5bc7396a","observation_id":"3f95c228-93b5-4a97-a1a6-c4029cf95e2f","resolution":{"observed_at":"2026-08-06T21:19:53.799591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T21:19:52.026803Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.026803Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:921d48539e13ff0e0d4bb803b2a784b3bf883c014f902ad9dd6fa24c9d23a3f8","observation_id":"b0ef3fd9-2231-4fd7-81ed-c7e16396d90c","resolution":{"observed_at":"2026-08-06T21:19:52.026803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.490116Z","title":null,"venue":null,"work_id":"a286230f-0950-412a-9778-2e3758b8b802","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.102249Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:34cfa90ef9676909156e70f08449492a40ff747e1c1491c762f76df25bdf0c7c","observation_id":"42454f16-fcba-4cd1-8889-8dc3634c7aaa","resolution":{"observed_at":"2026-08-06T21:19:55.650955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.02058","last_updated":"2022-08-15T18:38:37Z","snapshot_observed_at":"2026-08-13T15:50:14.464747Z","submitted_at":"2022-05-04T13:34:07Z","title":"SVTS: Scalable Video-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.02058","snapshot_observed_at":"2026-08-06T21:19:52.154124Z","title":"W.; and Pantic, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.154124Z"},"links":{"cited_paper":"/paper/2205.02058","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:276a73ce0a740ed48b9c7254a27b42ecf456e646a389bfbf10d1d5f3fc2cb5ef","observation_id":"2349b402-a25c-4f30-8019-de0503723d04","resolution":{"observed_at":"2026-08-06T21:19:52.154124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.248038Z","title":null,"venue":null,"work_id":"e15fcad6-bc43-4946-b190-ed6b5053a4a5","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.238451Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:f26e135b49f4779998bb698ec6923852e0038e020893a53497cc78e6da3db7ef","observation_id":"1ddb64d0-3d9b-4bab-bbd4-67d91f2768f6","resolution":{"observed_at":"2026-08-06T21:19:55.361477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08209","last_updated":"2020-05-17T10:29:19Z","snapshot_observed_at":"2026-07-30T23:40:19.839097Z","submitted_at":"2020-05-17T10:29:19Z","title":"Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2005.08209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.08209","snapshot_observed_at":"2026-08-06T21:19:53.642326Z","title":"Learning Individual Speaking Styles for Accurate Lip to Speech Synthesis","venue":"cs.CV","work_id":"d7d0a855-01fb-458e-8fba-7d255bbf9d07","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.300850Z"},"links":{"cited_paper":"/paper/2005.08209","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:82a0825995b0f304a84fa45ce0a4aee6ad821ffc6f7bd54a933b6ca74ee92862","observation_id":"8c51ab8f-2738-4bce-b9e7-13c903ae60b7","resolution":{"observed_at":"2026-08-06T21:19:53.678456Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:55.119305Z","title":"R.; Mukhopadhyay, R.; Namboodiri, V","venue":null,"work_id":"887fe846-650e-46b0-b0b5-5bfa65046dba","year":2020},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.373040Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:b85ebbe0e4d0d6f4a870e40de98b138ed3a3fb28aded3f44acab24f409e79543","observation_id":"aa72b93c-a3f2-4fc3-b831-72dac0197c3a","resolution":{"observed_at":"2026-08-06T21:19:55.151833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-06T21:19:52.448733Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; Krueger, G.; and Sutskever, I","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.448733Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:5b11f0c29fbbc0c18731699ac6d2ce6a0e570f0f5d99479daff49b4cecb31c82","observation_id":"fc331158-e15a-4a77-a0e5-f0ce5bbd55f1","resolution":{"observed_at":"2026-08-06T21:19:52.448733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00700","last_updated":"2024-09-01T11:51:18Z","snapshot_observed_at":"2026-08-12T22:53:39.229918Z","submitted_at":"2024-09-01T11:51:18Z","title":"Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion","version":1},"cited_work":{"arxiv_id":"2409.00700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00700","snapshot_observed_at":"2026-08-06T21:19:53.508102Z","title":"Seeing Your Speech Style: A Novel Zero-Shot Identity-Disentanglement Face-based Voice Conversion","venue":"cs.SD","work_id":"2b8e3cf2-3cb3-4fe6-932d-067ba3a88650","year":2024},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.494181Z"},"links":{"cited_paper":"/paper/2409.00700","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:a85255f583cd0d7cad764d6b91f390a4c06da6c1f4b67c7b9b46fee65f48f1c4","observation_id":"74b17056-4bc1-417d-8f27-8f6839385594","resolution":{"observed_at":"2026-08-06T21:19:53.571796Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10483","last_updated":"2021-12-20T12:33:33Z","snapshot_observed_at":"2026-07-06T12:20:36.165718Z","submitted_at":"2021-12-20T12:33:33Z","title":"Fusion and Orthogonal Projection for Improved Face-Voice Association","version":1},"cited_work":{"arxiv_id":"2112.10483","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.10483","snapshot_observed_at":"2026-08-06T21:19:53.400300Z","title":"Fusion and Orthogonal Projection for Improved Face-Voice Association","venue":"cs.CV","work_id":"c0e2e0df-3475-41bc-b52a-7a2624fa4a57","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.564281Z"},"links":{"cited_paper":"/paper/2112.10483","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:7620d42553ad4ec298811e1f260106c91e5891d45396697b8437af515da18d2e","observation_id":"e1c57262-d27c-4f3f-85df-687f200d9f9c","resolution":{"observed_at":"2026-08-06T21:19:53.437781Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.868319Z","title":null,"venue":null,"work_id":"b0c54c77-0ac6-4c23-b576-ce5bdecedc9b","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.620787Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:f65ec1430a40ab3d2288bb83dfa71cdcea0fb802f82b3082e01bbf3ae1f48f31","observation_id":"b0cc4085-4273-41c9-9173-25cbc1c6259d","resolution":{"observed_at":"2026-08-06T21:19:54.976495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-13T17:03:44.084494Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-06T21:19:52.685389Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.685389Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:87f40ced5ca5d0e1bdb94a85d26304f5ef2eddc70ea0e012d79889825e02b91c","observation_id":"3fcc39cd-9f1e-49b8-8764-0adcdd1345be","resolution":{"observed_at":"2026-08-06T21:19:52.685389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07180","last_updated":"2022-07-14T23:02:59Z","snapshot_observed_at":"2026-08-13T15:43:57.733685Z","submitted_at":"2022-05-15T04:48:41Z","title":"Learning Lip-Based Audio-Visual Speaker Embeddings with AV-HuBERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.07180","snapshot_observed_at":"2026-08-06T21:19:52.752908Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.752908Z"},"links":{"cited_paper":"/paper/2205.07180","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:0b4298fe340a356cb7dbdefd44639a2dab8d0df02ab182e3b1808d8d150f467a","observation_id":"8cb0660a-527a-42db-9ce8-43d9d600d0a5","resolution":{"observed_at":"2026-08-06T21:19:52.752908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-14T22:25:51.884597Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-06T21:19:52.819201Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.819201Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:9475440e0765ce8a137426ee11eff888ad883ae58ec9b41faf6689671db1b7c9","observation_id":"883da9ac-52a1-46e5-a25f-59b1be6e6c70","resolution":{"observed_at":"2026-08-06T21:19:52.819201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.615840Z","title":null,"venue":null,"work_id":"a73e95b2-4aaa-49c1-9c5c-9f5f3f406d6d","year":2018},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.880819Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:fdf52c18d17a421af03b497d3f37dc1303e8728ca91041c2d2de6ac21f4d7dc0","observation_id":"d725aa85-d2f9-4f6f-98c3-7f58e0c27f87","resolution":{"observed_at":"2026-08-06T21:19:54.737554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.465993Z","title":"T.; Chen, X.; Liu, X.; and Meng, H","venue":null,"work_id":"c76edd78-4235-425e-8ce4-f988b9b863d9","year":2021},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:52.983030Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:1a40ff6e0288d20517dddb9ea18b11009cc7a54a3f7a31f07cc10df75a6ab939","observation_id":"867fd800-a343-4e75-b653-fd511c8127b0","resolution":{"observed_at":"2026-08-06T21:19:54.506179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.343778Z","title":null,"venue":null,"work_id":"9dbdb12f-719c-42d8-ba94-c121337c9044","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.056506Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:2f0a25293d93426e820f38d11e800d46bf15d1243f368463c7ee877c4ebc7826","observation_id":"0ff7a1f0-01db-4f74-b9cc-9a39661c1e70","resolution":{"observed_at":"2026-08-06T21:19:54.402901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03258","last_updated":"2024-03-28T09:35:45Z","snapshot_observed_at":"2026-08-13T11:23:53.709192Z","submitted_at":"2023-06-05T21:20:33Z","title":"LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading","version":2},"cited_work":{"arxiv_id":"2306.03258","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.03258","snapshot_observed_at":"2026-08-06T21:19:53.247691Z","title":"LipVoicer: Generating Speech from Silent Videos Guided by Lip Reading","venue":"eess.AS","work_id":"58a366b0-7c37-4c2f-813a-192443510e83","year":2023},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.084783Z"},"links":{"cited_paper":"/paper/2306.03258","citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:f3118212dbe3f6fa558bd4e0fcc5a019b8f528573c807d7cef85c99b4cba24c8","observation_id":"ef9ea61d-c62b-4b58-aeae-317c2391e166","resolution":{"observed_at":"2026-08-06T21:19:53.314800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:19:54.216702Z","title":null,"venue":null,"work_id":"e5bace0d-0dfd-49cf-80bd-55d3d008a7ab","year":2022},"citing_paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:19:53.157881Z"},"links":{"citing_paper":"/paper/2507.00498"},"observation_digest":"sha256:67cbbd80e9def1ab77d7fd83c51f62216739571a065be164ac687c2a9a74b6b4","observation_id":"9e976be1-c64c-4263-a750-d09811322450","resolution":{"observed_at":"2026-08-06T21:19:54.271812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00498","last_updated":"2025-08-03T15:08:39Z","latest_version":3,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T05:55:49.445628Z","submitted_at":"2025-07-01T07:13:34Z","title":"MuteSwap: Visual-informed Silent Video Identity Conversion"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":23,"verified_exact":6,"verified_fuzzy":3},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2507.00498."}