{"as_of":"2026-08-11T01:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b01de7e222cd538b1e1377baff0ae2a24296a2be98c6133329a2f998bfe5665","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:50:00.951657Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:50:00.733134Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T14:25:47.176963Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21448","snapshot_observed_at":"2026-08-06T12:50:00.733134Z","title":"Audio-visual fusion model As shown in Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.733134Z"},"links":{"cited_paper":"/paper/2507.21448","citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:96fa0be009eda65a44ff1cacd8086f264eb6b835ab9f0f1a03f757ffcbe4b2bd","observation_id":"28cb8503-5e9d-4c82-9740-8c72d3551bec","resolution":{"observed_at":"2026-08-06T12:50:00.733134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"cited_work":{"arxiv_id":"2507.21448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21448","snapshot_observed_at":"2026-07-01T14:25:47.176963Z","title":"Real-time audio-visual speech enhancement using pre-trained visual representations,","venue":null,"work_id":"a3c4da02-b29a-4f9d-9797-1c8071b097e8","year":2025},"citing_paper":{"arxiv_id":"2605.13931","last_updated":"2026-05-27T00:11:29Z","snapshot_observed_at":"2026-08-03T23:47:52.521727Z","submitted_at":"2026-05-13T16:04:12Z","title":"FSD50K-Solo: Automated Curation of Single-Source Sound Events","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:18:08.991522Z"},"links":{"cited_paper":"/paper/2507.21448","citing_paper":"/paper/2605.13931"},"observation_digest":"sha256:2c0fbe5ca3c062902cf9afd19d3f59031b3ed185da7ec825b2ba71793529c2f3","observation_id":"b7317e6e-dbb0-42c4-8761-97e6f89fb4d3","resolution":{"observed_at":"2026-07-01T14:25:47.179446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.21448/citation-record","integrity":"/paper/2507.21448/integrity","json":"/paper/2507.21448/citation-record.json","paper":"/paper/2507.21448"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:08.087418Z","title":null,"venue":null,"work_id":"069b0812-8141-42b9-be21-e6da28b98403","year":null},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.727028Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:7e30fe6805e85eeeb7b1579b2aca35979244b24dafb23385a11960824bcae867","observation_id":"d106859a-c6e3-4b29-85e9-e2332ce048a8","resolution":{"observed_at":"2026-08-06T12:50:08.154237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21448","snapshot_observed_at":"2026-08-06T12:50:00.733134Z","title":"Audio-visual fusion model As shown in Fig","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.733134Z"},"links":{"cited_paper":"/paper/2507.21448","citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:96fa0be009eda65a44ff1cacd8086f264eb6b835ab9f0f1a03f757ffcbe4b2bd","observation_id":"28cb8503-5e9d-4c82-9740-8c72d3551bec","resolution":{"observed_at":"2026-08-06T12:50:00.733134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:07.739368Z","title":"Datasets We use V oxCeleb2 as the speech dataset and MUSAN for noise and music","venue":null,"work_id":"568db360-df4a-4082-b10e-f64ccf09ca32","year":null},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.738101Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:0519cc0fb2d89a8c2baba1cd38a35345316b29490437d0784acc707a89831bba","observation_id":"e9ee473f-0af7-45fd-a927-7e9eec61fc6a","resolution":{"observed_at":"2026-08-06T12:50:07.885831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:07.444786Z","title":null,"venue":null,"work_id":"2e9583f8-e22f-48dd-a941-5b752405a336","year":null},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.743249Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:70e8d4f5eaaab667b96066624c6eb4a6ffd3fd938fde1d24b8d1b4d63b1fbb3a","observation_id":"fe688ff9-3a4b-415d-ad9d-7da2dd460b0b","resolution":{"observed_at":"2026-08-06T12:50:07.587783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:07.123867Z","title":"We systemat- ically analyze how visual embeddings from audio-visual speech recognition (A VSR) and active speaker detection (ASD) im- pact A VSE performance","venue":null,"work_id":"f4d83740-a504-485c-b704-d0b39d6611b1","year":null},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.748919Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:9c0340d7537e33082e3300ff29ae53c6180533a2ca09909885966291237fbb7e","observation_id":"043a9f23-38cb-400b-b8aa-b8a7632bcb31","resolution":{"observed_at":"2026-08-06T12:50:07.283456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:06.818095Z","title":"Funda- mentals, present and future perspectives of speech enhancement,","venue":null,"work_id":"5b681b6f-b60d-4a5b-baef-67ea86be6138","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.754492Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:70f073d2405a3a0226e8ee530acf734e88dbdb51a3dfb842c0a50f730ec492b8","observation_id":"8cc567b3-95f6-49d6-affb-f61ab3fbe687","resolution":{"observed_at":"2026-08-06T12:50:06.957541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:06.541378Z","title":"An Overview of Deep-Learning-Based Audio-Visual Speech Enhancement and Separation,","venue":null,"work_id":"4e1612ba-08f7-42be-b377-8c865c2173f2","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.759259Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:68da6c1010f0a5e6fc5b9d6c142e3d55d3749c88aba10fb913866cec5394e1cd","observation_id":"6603e162-ab9a-48c5-87de-ad0fe3314878","resolution":{"observed_at":"2026-08-06T12:50:06.644010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:06.245285Z","title":"FlowA VSE: Effi- cient Audio-Visual Speech Enhancement with Conditional Flow Matching,","venue":null,"work_id":"86dc2e08-a9a7-4ee1-9b18-5a45d260c5e6","year":2024},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.764097Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:1d489bb63061b96e2012adab8c62b36ffe3f7774fddb698505022f1bc753e27c","observation_id":"a2b8f46e-57a4-4bc8-b7c1-2d3e777d5d76","resolution":{"observed_at":"2026-08-06T12:50:06.324806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:05.990901Z","title":"Personalized speech enhancement: new models and Comprehensive evaluation,","venue":null,"work_id":"148ec8ef-e675-429e-83f3-498fcb414a49","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.770003Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:60d797acd96bb79c6ca1fb53c2f30fefb5d02ded8d3dc733b6f8cd802a846914","observation_id":"f16c5e63-8812-4029-b90c-e8327b680cd1","resolution":{"observed_at":"2026-08-06T12:50:06.109228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:05.865167Z","title":"Real-Time Audio-Visual End-to-End Speech Enhancement,","venue":null,"work_id":"59141c56-68b8-4794-afa7-3c2c61c223cc","year":2023},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.775199Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:91dd7084b4b7b9af5263e635af7b378be35782dc235d56caac9f40860e286f54","observation_id":"ec41fe69-5a12-4ac1-9fa3-8f61a6135da1","resolution":{"observed_at":"2026-08-06T12:50:05.905454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:05.669352Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation,","venue":null,"work_id":"a1afcced-8ccf-4d53-a31b-5dd536c34afe","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.780437Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:91c3c718a9c80566674d118bad3b78063ee549af6c7b2de37da3b7c07e83af6d","observation_id":"93e19642-7f0d-45c4-b5c1-82a5c30dd41d","resolution":{"observed_at":"2026-08-06T12:50:05.752116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:05.403584Z","title":"The Conversation: Deep Audio-Visual Speech Enhancement,","venue":null,"work_id":"503f7fb1-dc6c-4c2a-96ff-be83af4dcfc4","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.785047Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:658013d9b73e283d37daaa5a6a7cb2829ae6cc0408f6e9a3002ee8cd5c3bd586","observation_id":"41dcc2f1-e283-4f1b-bfaf-dba2194b384e","resolution":{"observed_at":"2026-08-06T12:50:05.546179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:05.090491Z","title":"Improved Lite Audio- Visual Speech Enhancement,","venue":null,"work_id":"e9b427cf-ea26-4c7c-8455-df7c61881085","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.790878Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:2be233f33481c015f0bce1d195a23f0eaacd9c506b55dbfb38277c895673357f","observation_id":"71d3d07a-a00f-4cdc-ad8b-52e049c05e8c","resolution":{"observed_at":"2026-08-06T12:50:05.219113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:04.821515Z","title":"Lite Audio- Visual Speech Enhancement,","venue":null,"work_id":"399ae286-3c95-4491-b0ae-111c9408ea87","year":2020},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.800367Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:ab6dacdc8e830f251168f07a78303abc5b82828a746b32ac77c8f549c10a8855","observation_id":"6d7ade20-feb2-4ca5-a041-e58855dbae5b","resolution":{"observed_at":"2026-08-06T12:50:04.981991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:04.638406Z","title":"End-to-end Audio-visual Speech Recognition with Conformers,","venue":null,"work_id":"31d27f33-ee5c-4daf-96e5-776220a2b405","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.806913Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:c5be5b0f2eaa712e1ca3f51b974254770a9adad269424add29b9b665e9e79813","observation_id":"36ccab49-88be-4571-84f6-0b66294fdd9f","resolution":{"observed_at":"2026-08-06T12:50:04.721415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:04.370102Z","title":"Audio-Visual Speech Codecs: Rethinking Audio-Visual Speech Enhancement by Re-Synthesis,","venue":null,"work_id":"331b9947-6e7a-4c00-b39d-c1289240be08","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.815173Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:96758c1877dcf4a9be63674beea4359d1fa313db4056aa2e7f09e86086f5bed7","observation_id":"ff992ea9-cec4-4d7a-8524-b16de94de606","resolution":{"observed_at":"2026-08-06T12:50:04.471416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:04.179218Z","title":"A Novel Real-Time, Lightweight Chaotic-Encryption Scheme for Next- Generation Audio-Visual Hearing Aids,","venue":null,"work_id":"59d8c5c8-43b6-419d-8f49-13e4cb304e81","year":2020},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.819911Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:863e172b204078c978474a280bf03f41d13e604c0591efebbf4f138a2e745c73","observation_id":"58298bd1-13a6-4b4c-8c64-1303f715c0a7","resolution":{"observed_at":"2026-08-06T12:50:04.286004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.904191Z","title":"Lip- Reading Driven Deep Learning Approach for Speech Enhance- ment,","venue":null,"work_id":"231a8912-4a96-47e7-a813-5893fa7daac2","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.825003Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:6c2f756cff869e22c807b2b4bceea71d03a174cbeb42aa549720566ca147c473","observation_id":"bfb62780-2c0f-496b-9138-d95029e2e822","resolution":{"observed_at":"2026-08-06T12:50:04.040336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.742091Z","title":"Audio-visual speech enhancement using deep neural networks,","venue":null,"work_id":"ec4b3f8c-8412-4b76-8037-d5a1249748bf","year":2016},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.830370Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:62d3d07d9c9ad5ca4ddfb6ea18058f4e18f80d3886f66a1ea639f4afe0b638ca","observation_id":"456aca05-6cfe-4c8c-b3f7-9887d564587c","resolution":{"observed_at":"2026-08-06T12:50:03.809284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.586589Z","title":"Audio-Visual Scene Analysis with Self-Supervised Multisensory Features,","venue":null,"work_id":"76cf7ce2-3009-40c8-a1ad-47c42103d0e4","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.835131Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:fd8e2f91bd0beb178591a71c406094e0e3232bd97234bac71b0a2b4d2b6f8878","observation_id":"efe08a43-f7f2-46c9-977a-4fb752add33f","resolution":{"observed_at":"2026-08-06T12:50:03.656679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.383626Z","title":"Evaluating Audiovisual Source Separation in the Context of Video Conferencing,","venue":null,"work_id":"5e40b1dc-e50e-4c53-9d68-dafdf831cc10","year":2019},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.840466Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:cef5d2c1d70768f9aa03893e19dbd8690aee9fe3524f0f4eedd1617817c634bf","observation_id":"a7608f3b-cb83-422c-a4a2-ef088fc628f1","resolution":{"observed_at":"2026-08-06T12:50:03.495437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.202025Z","title":"CochleaNet: A robust language-independent audio-visual model for real-time speech enhancement,","venue":null,"work_id":"63d11bd0-bece-4f3d-b15d-b42f996ab5c4","year":2020},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.844890Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:92867ee19c87fdc5908ecf984698266a9290766216588dc34ef5e231579c3908","observation_id":"bb2528b1-7047-4d06-95f7-4707018a963d","resolution":{"observed_at":"2026-08-06T12:50:03.283326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:03.019763Z","title":"RT-LA-V ocE: Real- Time Low-SNR Audio-Visual Speech Enhancement,","venue":null,"work_id":"faa01af6-e2d8-4b01-9557-bee69a4f167f","year":2024},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.850747Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:dd583e7e42ef0d7e60bf231c00c246d98432d8015e9aaa864767b3fc2529548f","observation_id":"dbbd2a9a-9b4c-4af3-b48e-b3414632f914","resolution":{"observed_at":"2026-08-06T12:50:03.110631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:02.781593Z","title":"Exploring Tradeoffs in Models for Low-Latency Speech Enhancement,","venue":null,"work_id":"aaf85331-c12d-45d5-8434-ba3f17ad5cb8","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.855736Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:9eeecac88875c0f688300c2e9fa1e33a29c3e8371e402ed859a8189efb3c28bd","observation_id":"f9666af7-49c0-4b77-9739-43f790274900","resolution":{"observed_at":"2026-08-06T12:50:02.900687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:02.571328Z","title":"Phase- sensitive and recognition-boosted speech separation using deep recurrent neural networks,","venue":null,"work_id":"49989b2d-f590-421e-b42a-0e21d5c9bc08","year":2015},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.860441Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:c321fd0ef521b6bb9d44857aeba46c3c1fefb69e3bc347906dbdacb0b9447a3b","observation_id":"461f0d2d-4cb5-4788-ab00-c1ca4ef1c00a","resolution":{"observed_at":"2026-08-06T12:50:02.659182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.05470","last_updated":"2021-09-27T16:01:52Z","snapshot_observed_at":"2026-07-06T11:37:39.200050Z","submitted_at":"2021-08-11T23:03:31Z","title":"On The Compensation Between Magnitude and Phase in Speech Separation","version":2},"cited_work":{"arxiv_id":"2108.05470","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.05470","snapshot_observed_at":"2026-08-06T12:50:01.090362Z","title":"On The Compensation Between Magnitude and Phase in Speech Separation","venue":"cs.SD","work_id":"079cc0f2-fbe9-479e-995f-45de39c6216b","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.865694Z"},"links":{"cited_paper":"/paper/2108.05470","citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:25e01df096e321ee087cd0c66b216661d1e7929bd3a8209b8a62b044c6ad87e2","observation_id":"b1b86e74-3ec7-4364-90d5-71c309b90f24","resolution":{"observed_at":"2026-08-06T12:50:01.119128Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:02.352905Z","title":"Learn- ing Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction,","venue":null,"work_id":"921bc42e-6f4e-4953-a494-c718c40bdc0f","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.872092Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:0b1b2b457818ff0d59cbfb4c64b529d3c0188cf996037c9cf8e8336521b307be","observation_id":"35634989-c821-4f5d-9702-041a675255ac","resolution":{"observed_at":"2026-08-06T12:50:02.452880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:02.187499Z","title":"Robust Self-Supervised Audio-Visual Speech Recognition,","venue":null,"work_id":"d6ca795d-c96f-4884-9bbe-03c925d39353","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.877218Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:57e65cf4f93d1d13810abf243a66ccea7b92bfd36fb2ad1c56cb6adc17328e97","observation_id":"4be04175-9aba-4d25-8bb7-4c1f9d31a392","resolution":{"observed_at":"2026-08-06T12:50:02.254963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13084","last_updated":"2022-10-30T17:29:57Z","snapshot_observed_at":"2026-08-10T09:05:35.813252Z","submitted_at":"2022-02-26T07:21:00Z","title":"Visual Speech Recognition for Multiple Languages in the Wild","version":2},"cited_work":{"arxiv_id":"2202.13084","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.13084","snapshot_observed_at":"2026-08-06T12:50:01.023696Z","title":"Visual Speech Recognition for Multiple Languages in the Wild","venue":"cs.CV","work_id":"06e8060f-ff2a-40f7-96f4-3b3dac9b6d53","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.882251Z"},"links":{"cited_paper":"/paper/2202.13084","citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:535083f805d257a67594f16a7bd1c340c1a03e1ec38770e6f53d7d8078eb51ef","observation_id":"c83f124f-531d-47be-bf7d-6ed43c7bc8ae","resolution":{"observed_at":"2026-08-06T12:50:01.052996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06592","last_updated":"2021-07-25T15:00:51Z","snapshot_observed_at":"2026-08-05T01:33:12.418999Z","submitted_at":"2021-07-14T10:30:34Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06592","snapshot_observed_at":"2026-08-06T12:50:00.887904Z","title":"Is Someone Speaking? Exploring Long-term Temporal Features for Audio-visual Active Speaker Detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.887904Z"},"links":{"cited_paper":"/paper/2107.06592","citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:251cb0338257fe3bfd54cadc998a6388754351f3a76a9106ed1d3d9a94e66608","observation_id":"a4299ee8-9644-4ef2-b76c-783a57c86573","resolution":{"observed_at":"2026-08-06T12:50:00.887904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.961606Z","title":"LoCoNet: Long-Short Context Network for Active Speaker Detection,","venue":null,"work_id":"0e3504f5-27db-4e8c-80ae-cca92428ed1b","year":2024},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.894029Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:39d58aa9657f8a9757ee93b434d1213681d2bf2c118e4178f979717f2f881c5b","observation_id":"6e8efe7a-2f6a-453d-bc3b-1a8a4c1d2a22","resolution":{"observed_at":"2026-08-06T12:50:02.049957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.783472Z","title":"Deep Contextualized Word Representa- tions,","venue":null,"work_id":"d61d5c11-7971-42fa-b221-71ec602f28b2","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.899016Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:8f8220d482b95a45e4d4c653c5c1b0c4b154f507fe412c8b125e21a68fbedb11","observation_id":"623afb87-27a1-420f-b9e9-92d3d3dd2098","resolution":{"observed_at":"2026-08-06T12:50:01.878281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.591722Z","title":"Few- shot Image Classification: Just Use a Library of Pre-trained Fea- ture Extractors and a Simple Classifier,","venue":null,"work_id":"f0c18b90-f7e2-4542-a0f1-cb617319686b","year":2021},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.904678Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:294eab140b1ead6453f426669e2314f1813f21e357777d5db86c00024abbcf18","observation_id":"7ad79254-0c6a-4a76-add1-0af98ccf5185","resolution":{"observed_at":"2026-08-06T12:50:01.651568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.425646Z","title":"Music auto-tagging in the long tail: A few-shot approach,","venue":null,"work_id":"8b6351b9-227e-46d9-a966-892b5c9827dc","year":2024},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.909319Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:0cc3d9bf34c91a0f02887d084545ce285198c0dca28734e730d23e39ff5fedf6","observation_id":"6cdf9559-167c-4aa0-9035-ae8f6ba41f81","resolution":{"observed_at":"2026-08-06T12:50:01.472179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.386201Z","title":"Contextual String Em- beddings for Sequence Labeling,","venue":null,"work_id":"7b777e2d-b52c-47d1-bfa1-0c798dbabc3f","year":2018},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.918147Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:5e96de1681f9c505aed49e8f778e319ffb0a8e946afe429511dd412236c0f25f","observation_id":"7521eefd-a268-4a34-a654-eadff6bd0025","resolution":{"observed_at":"2026-08-06T12:50:01.398614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.342651Z","title":"DeepFilterNet: A Low Complexity Speech Enhancement Frame- work for Full-Band Audio based on Deep Filtering,","venue":null,"work_id":"cb6a1128-f86f-417d-bcb6-9cd048b899d9","year":2022},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.922916Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:3d092520b99a1a5aa479ef4835ebe4ab85ec9be4a2944402abac3378751aec9f","observation_id":"736da3cf-bdca-444d-8d34-8482e8162dea","resolution":{"observed_at":"2026-08-06T12:50:01.362977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.305823Z","title":"Perceptual eval- uation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"f9f7711f-3feb-48dd-949d-35e6438f51fc","year":2001},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.929172Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:517bd185afe16b8470548f0971d2e732cdb2bb5c1ef7fd8c497a54203d2d3a87","observation_id":"9a77b55c-e7fc-4f21-b061-7bf99b65d384","resolution":{"observed_at":"2026-08-06T12:50:01.319553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.263854Z","title":"SDR – Half-baked or Well Done?","venue":null,"work_id":"c3f1c705-c830-45ca-8746-1fd83c678c16","year":2019},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.933900Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:c279226056bba366961628fcf8f13cd8b826f381dd13e2466a90aaa71b6ded16","observation_id":"791b7492-0965-4f57-8f69-f1fd60cf026d","resolution":{"observed_at":"2026-08-06T12:50:01.278688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:00.938902Z","title":"An Algorithm for Predicting the In- telligibility of Speech Masked by Modulated Noise Maskers,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.938902Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:3f8052444ed9dbc55faf71accb44f2087cc98c6e96102d846257a72f50b68baf","observation_id":"cec44eee-4d81-4e17-a0fe-17ad826ce9d1","resolution":{"observed_at":"2026-08-06T12:50:00.938902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.209328Z","title":"ViSpeR: Multilingual Audio-Visual Speech Recognition,","venue":null,"work_id":"ca1300e3-aff2-41a3-bf4c-4b625dfd19ea","year":2024},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.945904Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:982ba10c853bd600d660ac93c2af97ac13db22c3742dd16f4ab593e6ae324ad1","observation_id":"587209d4-2447-4d2d-ab72-2a0335df526d","resolution":{"observed_at":"2026-08-06T12:50:01.224069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:50:01.170879Z","title":"MEAD: A Large-Scale Audio-Visual Dataset for Emotional Talking-Face Generation,","venue":null,"work_id":"89c8bb55-b1cc-41de-94f1-f3ec38e0069e","year":2020},"citing_paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:50:00.951657Z"},"links":{"citing_paper":"/paper/2507.21448"},"observation_digest":"sha256:0930eb107c13f64eeacc2d8f2f2458065ef8d80c7c6af9744164c60bcd1edbc0","observation_id":"4c3a8019-162a-48d6-b28a-553cc93946d2","resolution":{"observed_at":"2026-08-06T12:50:01.187419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.21448","last_updated":"2025-08-04T16:20:43Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T12:50:00.349677Z","submitted_at":"2025-07-29T02:38:56Z","title":"Real-Time Audio-Visual Speech Enhancement Using Pre-trained Visual Representations"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":2,"verified_fuzzy":34},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 2 inbound Pith citation observations for arXiv:2507.21448."}