{"as_of":"2026-08-13T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:312b41abf46ef3d211fe7b7985db6919eda35469ad49500e300cdbb3bc69a4d9","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:15.460678Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:13.022735Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:21:15.811155Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"cited_work":{"arxiv_id":"2505.22024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22024","snapshot_observed_at":"2026-08-07T13:21:15.811155Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","venue":"cs.SD","work_id":"eb0491e3-ec8d-480b-a7b3-8483755f7f94","year":2025},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.022735Z"},"links":{"cited_paper":"/paper/2505.22024","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:54b196518f7ee3da90d9e31c7b95689139658746e82ccf8041e9051a2271a1ab","observation_id":"9a1b0569-55db-4704-b26b-f58a996c0814","resolution":{"observed_at":"2026-08-07T13:21:15.863647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22024/citation-record","integrity":"/paper/2505.22024/integrity","json":"/paper/2505.22024/citation-record.json","paper":"/paper/2505.22024"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:21.637945Z","title":"L2S holds great potential across various domains, from enhancing communication in noisy environments to providing assistive technologies for individuals with aphonia","venue":null,"work_id":"3a5270f9-4dd0-486b-a91b-e2c2ff3f8b68","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:12.974179Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:520a56b94aabd6d84bf3b904a1469e368f8b930c41fecef9dd125312d08ead8e","observation_id":"ed1c5e6b-449f-4e0f-becd-290f036641e4","resolution":{"observed_at":"2026-08-07T13:21:21.782699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"cited_work":{"arxiv_id":"2505.22024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22024","snapshot_observed_at":"2026-08-07T13:21:15.811155Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","venue":"cs.SD","work_id":"eb0491e3-ec8d-480b-a7b3-8483755f7f94","year":2025},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.022735Z"},"links":{"cited_paper":"/paper/2505.22024","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:54b196518f7ee3da90d9e31c7b95689139658746e82ccf8041e9051a2271a1ab","observation_id":"9a1b0569-55db-4704-b26b-f58a996c0814","resolution":{"observed_at":"2026-08-07T13:21:15.863647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:21.411635Z","title":"Datasets LRS2-BBC[25] is an English audio-visual dataset from BBC programs, comprising over 220 hours of video","venue":null,"work_id":"76a2acfe-91f2-4d4c-938e-862a696fe026","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.105023Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:e66a1590c353974e718e23ce2c6a1bd44a3f23e7811021a09b00b96d09d5b5c4","observation_id":"112078a0-0eb7-4c59-9ab8-6ed09a77ef0f","resolution":{"observed_at":"2026-08-07T13:21:21.506731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:20.943414Z","title":null,"venue":null,"work_id":"9d201962-08aa-4d53-a429-75724c91f7c8","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.304657Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:3aabb997f511b380f1e213d470af172c1a246b4287f91ce88b05e044d9ef429d","observation_id":"94b33b3c-1bc4-4513-9272-94e998abd5bb","resolution":{"observed_at":"2026-08-07T13:21:20.982518Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:20.808935Z","title":"Grounded in source-filter theory, RESOUND separates speech generation into acoustic and semantic branches, capturing prosody and linguistic con- tent","venue":null,"work_id":"76e21f87-53e1-446d-bfba-8f6addc9daf8","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.354854Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:3f80823bb8502a6e31706c7d676e5fa93bbefd23a536899a46e53484abe46f7c","observation_id":"ac18ebce-cb78-4f5a-9a3f-5ec3710a5796","resolution":{"observed_at":"2026-08-07T13:21:20.884251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:13.745946Z","title":"An audio- visual corpus for speech perception and automatic speech recog- nition,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.745946Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:60d4ffcfa3730b2a2c3f0be2a26ea2775638d1a7e4f60e6213670ad8f9f1d9ef","observation_id":"9fcaeeb4-fdd8-4bec-9b4f-409ef1f3fd91","resolution":{"observed_at":"2026-08-07T13:21:13.745946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:20.600452Z","title":"Flow- based unconstrained lip to speech generation,","venue":null,"work_id":"31197324-52a2-4fc2-bf70-c137dfcfdf27","year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.439345Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:0ed863b1e5c5936f4855830f237326db50f81a795509b33b2de110774089f887","observation_id":"939e9ab7-2f22-416b-8828-58a7b302dde1","resolution":{"observed_at":"2026-08-07T13:21:20.690179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:20.306952Z","title":"Let there be sound: Recon- structing high quality speech from silent videos,","venue":null,"work_id":"b14b0561-6bf9-4102-9099-0bba8b3134be","year":2024},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.530458Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:0e753aab66ed0b4af5bfaf51dcaea7910c7bde4549707ecc485d3d55df182308","observation_id":"a14423a1-dcf1-45af-8248-7df01ac594da","resolution":{"observed_at":"2026-08-07T13:21:20.485338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:20.121998Z","title":"Lip to speech synthesis with visual context attentional gan,","venue":null,"work_id":"5e153807-f1b0-4ca5-ad0a-804c34bd6228","year":2021},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.594360Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:88f763d43b9b9e8467dc2a05a1f2df63ffdd7a85caaecb98e60b8a2db717da58","observation_id":"12590acf-fc47-4f56-bde0-69b8355a6598","resolution":{"observed_at":"2026-08-07T13:21:20.160550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.865105Z","title":"End-to-end video-to-speech synthesis using gener- ative adversarial networks,","venue":null,"work_id":"51bf5363-f2f5-4be0-88a2-7335cdc2be36","year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.643137Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:909abe01d1e4213be0d610c48c010b6728ca24a769d887de13bc4f14539394cc","observation_id":"e5d87d50-5322-49b3-8b42-01c5a04cb33c","resolution":{"observed_at":"2026-08-07T13:21:19.969415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.748029Z","title":"Tcd-timit: An audio-visual corpus of continuous speech,","venue":null,"work_id":"04210912-ce64-4ff2-81e5-19adde8355b4","year":2015},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.687135Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:f8897b16b78bd6686866d90328f16fba1a68f9a0b34b6b4c8cce1fc9a6f5c3ae","observation_id":"5a7e119c-0cf9-4212-881a-cdc5ec7dc7e1","resolution":{"observed_at":"2026-08-07T13:21:19.779378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:18.456061Z","title":"Lipvoicer: Generating speech from silent videos guided by lip reading,","venue":null,"work_id":"30765b5f-d829-4a36-a173-5007602d25c2","year":2024},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.114697Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:8330c4d8cd13fd043f8658b2b479c0bf83ecd68a246fcd38112bb6e306abfcbd","observation_id":"7aa21951-6345-4de6-8623-56c6f6075bdc","resolution":{"observed_at":"2026-08-07T13:21:18.541878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.514547Z","title":"Learning individual speaking styles for accurate lip to speech synthesis,","venue":null,"work_id":"4ff50f61-ef5c-446f-801b-2490d44e0682","year":2020},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.827137Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:e579620969fbd0cf9e0214a23e9622d22f90df0a693926c45308c4e9e28b0628","observation_id":"8cb68e3a-1fd5-4981-a86b-4bddec5dea5e","resolution":{"observed_at":"2026-08-07T13:21:19.586523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.386600Z","title":"Revise: Self-supervised speech resynthesis with visual input for univer- sal and generalized speech regeneration,","venue":null,"work_id":"ec64c87e-3eaf-4e30-b304-823251bd90e1","year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.913971Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:fd3a86b1f0344b7a1a316dc1374de24b0e1a3d7e1183d4bbc659dfc421a25051","observation_id":"ba66d99b-65b1-430c-89d0-c03af3704cfd","resolution":{"observed_at":"2026-08-07T13:21:19.425846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.167560Z","title":"Intelligible lip-to-speech synthe- sis with speech units,","venue":null,"work_id":"e19a576b-2b5b-455a-a01a-5295f24aa631","year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.945608Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:f8bbe26ff6509ab453f473081b31a2804ed7087a9d74bc7b4326489815d26689","observation_id":"69278784-47c7-453e-a891-8d07d690fb45","resolution":{"observed_at":"2026-08-07T13:21:19.256905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:19.000881Z","title":"Uni-dubbing: Zero-shot speech synthe- sis from visual articulation,","venue":null,"work_id":"73cc42b5-8707-484d-82a0-4c8aa596fa52","year":2024},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.981558Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:3f47ad5a606367349f3069e57dcdd431e16b48f037bac01c35899115d20a6f9f","observation_id":"1b1b669b-876a-4acf-b18f-b553bbbf7346","resolution":{"observed_at":"2026-08-07T13:21:19.082692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:18.703180Z","title":"Lip-to-speech synthesis in the wild with multi-task learning,","venue":null,"work_id":"4e763a6f-1dd8-4152-86d1-a94e101aed54","year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.048257Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:712d64b30240bc4526600b625998343bb0c712dca804031308424f02242a051f","observation_id":"5ae47607-b2d3-45b9-bbdd-cb089a3c1398","resolution":{"observed_at":"2026-08-07T13:21:18.875851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:17.468853Z","title":"MultiVerse: Efficient and expressive zero-shot multi-task text-to-speech,","venue":null,"work_id":"dd542e04-9109-4c94-ae8f-56f1017a0cd7","year":2024},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.535892Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:7930a8ef2016302abd024979b2999308db27b320ee707b9cecc7d8c4fa8be26d","observation_id":"0a94b2e8-b246-455e-be65-cd0701c47e14","resolution":{"observed_at":"2026-08-07T13:21:17.532690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:18.292768Z","title":"Towards accurate lip-to-speech synthesis in-the-wild,","venue":null,"work_id":"fb4e00e9-c934-4166-8aa3-9274e0d63867","year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.221956Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:8e593a4a8ed9c5c7fd1a9673324a811075199480cfa316025abfb6e88d3ac9e7","observation_id":"aeb6d7a5-5311-478a-b337-e08c1dd8598e","resolution":{"observed_at":"2026-08-07T13:21:18.365679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:14.257768Z","title":"DiffV2S: Diffusion-based Video-to-Speech Synthesis with Vision-guided Speaker Embed- ding ,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.257768Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:a3047530be9147bffc7a413f36d10c5ac3a540f3919d2acd45768c7ed77ef3ea","observation_id":"e6f5ef46-6659-41b6-ad93-fbd07d562055","resolution":{"observed_at":"2026-08-07T13:21:14.257768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:18.119663Z","title":"The source–filter theory of speech,","venue":null,"work_id":"564e3612-c0cd-45fe-af4d-bf2483e44cb1","year":2021},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.317395Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:61cf28fad39d4ef39946ab22b0dfa83c25f7e7cd32f8520f9491e37766f5baf6","observation_id":"16226863-87a8-48ca-91d2-df9c895c5109","resolution":{"observed_at":"2026-08-07T13:21:18.211795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:17.910920Z","title":"Fant,Acoustic theory of speech production,","venue":null,"work_id":"716ca690-f952-4d7e-b39b-259b590d6e9a","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.377177Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:1f9138a6f1d9d8623618418051b8bc9f1613211dd3de83ac2458c8e02a8cab89","observation_id":"4bf9742b-496b-4a06-967f-7eae7023f0a0","resolution":{"observed_at":"2026-08-07T13:21:18.037421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.09364","last_updated":"2020-06-24T00:57:25Z","snapshot_observed_at":"2026-08-12T08:04:37.457488Z","submitted_at":"2018-11-23T05:24:15Z","title":"Learning pronunciation from a foreign language in speech synthesis networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.09364","snapshot_observed_at":"2026-08-07T13:21:14.918183Z","title":"Learning pronunciation from a foreign language in speech synthesis networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.918183Z"},"links":{"cited_paper":"/paper/1811.09364","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:6ae579e9cdbb5fc5ee72839200d3c27da4c9df49b0c0064c4e4c50250bf8445a","observation_id":"e3f49fac-acb4-4224-a430-1228f71dab60","resolution":{"observed_at":"2026-08-07T13:21:14.918183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:17.586257Z","title":"Fastpitchfor- mant: Source-filter based decomposed modeling for speech syn- thesis,","venue":null,"work_id":"bec33fb6-43f9-4396-9c4b-c55cd9e10162","year":2021},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.503233Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:bb12328fa51b565069e43629757c2fe1a54ff7c42b51059cf8ae632345fb1a98","observation_id":"08588f09-25f7-4c70-839c-e21b84f64bfc","resolution":{"observed_at":"2026-08-07T13:21:17.675755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.079405Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.079405Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:48a81048042e2bf8a7d939b3ee29af385fac027b9b6e9543d443af4153800b29","observation_id":"3a36e45a-99bf-457a-a4dd-989f8aecfb3a","resolution":{"observed_at":"2026-08-07T13:21:15.079405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:17.190687Z","title":"Clova baseline system for the voxceleb speaker recognition challenge 2020,","venue":null,"work_id":"70bb4434-b0f6-463c-b92a-b334e9ad8cf7","year":2020},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.567438Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:8fa31088e86e739cce7f6770fa050b2b0b4e23a43a0116bcd57945238587d4d7","observation_id":"d377d047-9ca5-4eb2-94c8-7c1839a2cd8a","resolution":{"observed_at":"2026-08-07T13:21:17.309864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.237937Z","title":"Svts: Scalable video-to-speech synthe- sis,","venue":null,"work_id":"54313b4e-ff49-434a-bd56-6e1c9c455172","year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.194847Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:1fb7ef6790c1d95fb391999cdf7095a6682bdac43c2cd22843c0fd263ae27698","observation_id":"580f29b4-8fee-4de9-9cf5-e68cb316e3af","resolution":{"observed_at":"2026-08-07T13:21:16.263092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:21.123716Z","title":"SECS scores are computed viaResemblyzer2, while WER is derived from Auto-A VSR [22]","venue":null,"work_id":"49a2c55b-2ab9-4574-8d3c-87fb11854257","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:13.194903Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:a9f37af6ee244e1afcc9d52dd6d6c9a028733d8e553abddcbfd7d0313d1cf1c4","observation_id":"2f5f3524-fde5-4c11-aa65-0ebf158c048b","resolution":{"observed_at":"2026-08-07T13:21:21.255056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.916751Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"3cb3738a-a9b5-4629-8899-5a2e706167fc","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.710994Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:01fc5c89c4d773587701728a5ebe79a4c42324b907ef98a607b57b52514bd070","observation_id":"0b73cfd3-47bd-4fe8-87e2-5abed2767698","resolution":{"observed_at":"2026-08-07T13:21:17.012995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.664103Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"a0992475-ea61-4374-9295-82573c2ed8b5","year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.826333Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:0dc20766b6bbc1b113fbe96f5a5ebe535614a83a47b041a4a08426724392f7d9","observation_id":"70147acb-db85-4742-9d2f-38abdbbae88f","resolution":{"observed_at":"2026-08-07T13:21:16.763456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:16.365898Z","title":"Auto-avsr: Audio-visual speech recognition with automatic labels,","venue":null,"work_id":"87b73a79-3eed-4f60-b89e-9780988d8cb7","year":2023},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.856745Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:b7bb7f5a0a88e34adace87862c8b2788020e20eb2890a8bae491de6d5a60258f","observation_id":"ae494202-97d9-4c93-918f-92eef79ed1af","resolution":{"observed_at":"2026-08-07T13:21:16.525923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.011648Z","title":"Conformer: Convolution-augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.011648Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:dab992ef91de7e3e0a5fc1066cc3fecaacb1407e5f2eb182ae9e2d75d255f538","observation_id":"55211103-8a43-46bb-b29d-a37c082b9928","resolution":{"observed_at":"2026-08-07T13:21:15.011648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T13:21:15.124650Z","title":"Lrs3-ted: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.124650Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:792c14cf06e060a4c9afaf456862c486f7fa46d50dca9cea5b02cdc6f34f7100","observation_id":"7ac304ed-52b1-4e77-89f7-84f1048d182f","resolution":{"observed_at":"2026-08-07T13:21:15.124650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.289377Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.289377Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:ecb152685a593dba6ab330f43300236716577ee26ccaee2c0111a0b44bf979fb","observation_id":"a88cb763-94ef-4bbd-8982-eae46c053ccc","resolution":{"observed_at":"2026-08-07T13:21:15.289377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.365940Z","title":"An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.365940Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:71c681d254834d0069f2d56dfeb1496ed8cffd9b8a55ed0e4387c1d52ebf8539","observation_id":"7f2858f7-cf06-4743-b941-09eec760ae53","resolution":{"observed_at":"2026-08-07T13:21:15.365940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:15.986999Z","title":"V2c: Visual voice cloning,","venue":null,"work_id":"6019fdd7-8e3c-4ac8-923f-a31a767f62b5","year":2022},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.419786Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:91472180ae51712115aea692b71533b3b6c52b10bab429b42b3f25c138aaefb7","observation_id":"0c69e97d-8e43-45b7-a7b7-dec921497fd8","resolution":{"observed_at":"2026-08-07T13:21:16.083512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T13:21:15.460678Z","title":"Mediapipe: A framework for building perception pipelines,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:15.460678Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:6808a52fed783fb17592c27c4746382fd15033b762c49e5d01860cc4d06e5368","observation_id":"a890cb67-21a3-48f4-8b45-c3a739fb3ee1","resolution":{"observed_at":"2026-08-07T13:21:15.460678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:21:17.768585Z","title":"Available: https://www.amazon.com/ Acoustic-Production-Description-Analysis-Contemporary/dp/ 9027916004","venue":null,"work_id":"403c0d75-8c01-403f-b3cf-0c899c34e482","year":null},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.451358Z"},"links":{"citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:df6c21d5c637e77ae61f5c09f08dc8ff944721cbcc41da7d323206e425c90c7c","observation_id":"34789cbc-584f-4bd5-ba4c-82fde38d268d","resolution":{"observed_at":"2026-08-07T13:21:17.826042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14153","last_updated":"2020-09-29T16:55:25Z","snapshot_observed_at":"2026-08-07T10:06:53.626763Z","submitted_at":"2020-09-29T16:55:25Z","title":"Clova Baseline System for the VoxCeleb Speaker Recognition Challenge 2020","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14153","snapshot_observed_at":"2026-08-07T13:21:14.602553Z","title":"Available: https://arxiv.org/abs/2009.14153","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.602553Z"},"links":{"cited_paper":"/paper/2009.14153","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:df3b9a8002ec550d029993088f486444100094848ea2df002544bb91bdd278e8","observation_id":"4701dbe3-f101-4bd3-aeb1-a733f740a460","resolution":{"observed_at":"2026-08-07T13:21:14.602553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-07T13:21:14.783720Z","title":"Available: https://arxiv.org/abs/2006.04558","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:14.783720Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2505.22024"},"observation_digest":"sha256:9f0cc6e2130b3cd3da52db2bd239bd4cd3dc555ff020613c005f3edd3b5da738","observation_id":"bf85582c-7e86-4658-a5b5-f5e2cdf7c42d","resolution":{"observed_at":"2026-08-07T13:21:14.783720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22024","last_updated":"2025-05-28T06:46:13Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-10T01:59:42.061418Z","submitted_at":"2025-05-28T06:46:13Z","title":"RESOUND: Speech Reconstruction from Silent Videos via Acoustic-Semantic Decomposed Modeling"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.22024."}