{"as_of":"2026-08-22T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf7c45d873a8826c9042aad2f2609e25c161089436ab3e8c13391ab8c60a043a","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T23:17:45.299833Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T23:17:45.299833Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T22:49:01.384665Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2606.23712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23712","snapshot_observed_at":"2026-07-03T22:49:01.384665Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","venue":"eess.SP","work_id":"ceefdbb9-e54e-491c-8cbd-5973fd1ddb5c","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2606.23712","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:8a1e4da5adfbb0c72b27054c08904187a97bdd78ab374b9d04c9f9a5abedb02a","observation_id":"89dbd48a-c87c-4bca-acaa-4f190bf0b482","resolution":{"observed_at":"2026-07-03T22:49:01.387089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.23712/citation-record","integrity":"/paper/2606.23712/integrity","json":"/paper/2606.23712/citation-record.json","paper":"/paper/2606.23712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Recent deep learn- ing approaches have significantly improved performance [1–3], with generative modeling frameworks emerging as a powerful direction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:f86c96c7189333a6fa06909cdf4c17f36be2824e498e1dd1834248348e224220","observation_id":"5deb219c-beb9-49e1-b4f4-5d425e4dabe3","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"cited_work":{"arxiv_id":"2606.23712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.23712","snapshot_observed_at":"2026-07-03T22:49:01.384665Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","venue":"eess.SP","work_id":"ceefdbb9-e54e-491c-8cbd-5973fd1ddb5c","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2606.23712","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:8a1e4da5adfbb0c72b27054c08904187a97bdd78ab374b9d04c9f9a5abedb02a","observation_id":"89dbd48a-c87c-4bca-acaa-4f190bf0b482","resolution":{"observed_at":"2026-07-03T22:49:01.387089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"1, describing how the audio-visual con- trastive loss is computed and the motivation behind it","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:320a259eec8d72aa3007e7bd1dc0aad8c2c2b8a53eb82ffcfe9044c4fa09cbf3","observation_id":"a9516dbd-c7dc-4cc8-9b84-34a969b732b5","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"As baselines, we con- sider A V-DiffUSEEN, with cross-attention fusion [8, 13], the audio-only version, AO-DiffUSEEN [13], and the supervised- generative FlowA VSE model [7]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:291df44d65f5a3ce195dd6ee539214fca403c7bcb5747541abc8557fc5473c61","observation_id":"29ed98d9-149b-47af-ad22-c702fad92144","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Matched condition: TCD-DEMAND Under matched conditions (Table 1), the proposed model im- proves all metrics compared to A V-DiffUSEEN","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ff8da766042cc214aa23c64374e2ecf9ac97fd2e3e84a57c54917e7feb6725e5","observation_id":"78d6f946-dbcc-498e-a989-35221d479999","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"During the pretraining of the visual-conditioned speech diffusion model, we augment the denoising score matching ob- jective with a contrastive audio-visual alignment loss","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:c81b09ce0756d4e631c570a1e763e4fdf2accb44f938ceab728cdf7b11540b6c","observation_id":"524e131a-c194-485f-a7c3-9ed5ce3046b2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:8857261a051ec20b79eb7524073510bc6b93ba2625ef49664a0ceb8d9ce7af80","observation_id":"a8dccfb8-f91f-46f7-82d7-19fd41abd647","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Generative AI tools were only used to edit and polish some portions of the manuscript","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:41e16ada2245543d0937d4dad1572e2923cfa24bb36f80f4d4cf1732e842bb94","observation_id":"abe0aa72-a4df-4085-a5ff-2157cc113e88","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SEGAN: Speech enhancement generative adversarial network,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:1705e17a1439873f4a3ad9d053f9d4892840ef444ed89812f27a2cc23451c553","observation_id":"bc98de02-c35e-4519-9557-50233c8b473a","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:08f47646c53599f99287fe5fb4d6354c6b9372f821976693e7b61af83fcb5883","observation_id":"42c0a82b-ce2c-4996-9b44-0c0f8463d353","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"DCCRN: Deep complex convolution recurrent network for phase-aware speech enhancement,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:a0083f6fef5b6e70b8c140895aabb2f1a26432f74504b90848d821b9b7243cbd","observation_id":"7836dbb8-7d74-40fb-ae77-af0bb744b29d","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Speech enhancement and dereverberation with diffusion-based gen- erative models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:c30cf986ced385deaaa731f1f598630561196777bf821ba75835eddcfb1d4ba6","observation_id":"7e54e6c0-1e8e-4fe8-9274-037b1169f730","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ca4e0fe912446587406418d0556fc2f8e5da0330b7fdb475868b11651d8b20a9","observation_id":"ccded98c-1c52-4c7c-a183-7c800ab26646","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Audio-visual speech enhancement using multimodal deep con- volutional neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:8d3acc19c4efe04263121f34d2b2879c2596c980500655bad1a2a7e04fb09081","observation_id":"6e168e88-24da-43a7-9283-ded77279913f","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"FlowA VSE: Efficient audio-visual speech enhancement with conditional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:a4f70cf1e909d610d065fd58c2e4004a541555c761ca78352a5ce72f10a3a4c8","observation_id":"2fa0d510-f391-4a3f-97a8-4915a7be2514","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Diffusion-based unsupervised audio-visual speech enhancement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:3fd39cc1bc639a428f97e0a0854be622f077e86139708de07653659ea0df9908","observation_id":"0c7e79e7-2730-4bf5-a57d-4f0ba8828a25","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"An overview of deep-learning-based audio-visual speech enhancement and separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:b521aef9003a0087a7178fa1f414931c73948c0066248b6f2eeb2a6a96793ac5","observation_id":"00df5926-de7b-48df-95f8-0b002ed8d94a","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:035bca7ef7cf030d218519fdf8117ada03ff238b791699e9f50f0c9a8218c688","observation_id":"3b129cf7-9d46-4a10-83dc-ebecdac0bbec","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"CLAP: Learn- ing audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:bc2a77de496270d57fd724fbf24cd1b159b4db9aed6cfbfdb71ad9c4be661c0f","observation_id":"3ed6430b-a876-42ef-a7b3-fc3397cc4d8c","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SA V-SE: Scene-aware audio-visual speech enhancement with selective state space model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:5e0e474abf5c5ce531ce799c99a896a64ef0b056b425dbe71855e83c2b651a9c","observation_id":"032e5418-8cae-463e-87a7-1922dc297312","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.09931","last_updated":"2026-05-23T22:38:42Z","snapshot_observed_at":"2026-08-16T05:00:13.846291Z","submitted_at":"2026-01-14T23:25:56Z","title":"Diffusion-based Frameworks for Unsupervised Speech Enhancement","version":4},"cited_work":{"arxiv_id":"2601.09931","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.09931","snapshot_observed_at":"2026-07-03T22:49:01.370716Z","title":"Diffusion-based Frameworks for Unsupervised Speech Enhancement","venue":"cs.SD","work_id":"038324f7-514b-459e-8ea8-196a07705068","year":2026},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2601.09931","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:4d3fdb82b1ec1c3359e6e34f16c309e6d14e238e843ef79fdb7714923be6f67c","observation_id":"f9107a07-13aa-4db5-aaa1-dd0767c09fdb","resolution":{"observed_at":"2026-07-03T22:49:01.372695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Score-based generative modeling through stochastic differ- ential equations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:1f9a015615ce80357fdd71d3c890dc25d875961a878376443f3c02e675598f7d","observation_id":"9ec4f8fc-b3ab-4292-9e12-fb2a8417dbf2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Nonnegative matrix factor- ization with the itakura-saito divergence: With application to music analysis,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ed31af57096db2b3d5bf3a841acddfe50717028ea436b7d8ea6f84ae81c7d919","observation_id":"4ad42cd0-8bd9-49ef-ac26-3299a6263287","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Tweedie’s formula and selection bias,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:82d63266013a94b55d98c10de384a155809518ffac1cf1c35b145f7feb700e48","observation_id":"4637457c-8421-4014-a872-d69d9cc1cda5","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Deep residual learning for im- age recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:1b307ad68be57383ea4445d47e3ec70582b34d5b78f070003497b27e9e910f1c","observation_id":"eea11571-501f-4479-acdc-02b3503f7786","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-21T16:22:35.183007Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":"2201.02184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-07-04T08:49:41.728084Z","title":"Learning audio-visual speech representa- tion by masked multimodal cluster prediction","venue":null,"work_id":"2e8fb221-cf84-40aa-a1b3-76de79871327","year":2022},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:cc64d8159bfed6c9d801a9f42baf89fb21ad94aba9fc3c55507570a586ab5f77","observation_id":"524a6f4f-0fc6-4ba4-a4ca-47e4a843d284","resolution":{"observed_at":"2026-07-03T22:49:01.368464Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:0207736863193cbaaeffb4b3fa56e5c4365d77a9ecb842a6b1b4ddc8a7e76e45","observation_id":"7d69518e-b9cd-4010-9d25-aa3d18057d95","resolution":{"observed_at":"2026-07-03T22:49:01.377870Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"TCD-TIMIT: An audio-visual corpus of con- tinuous speech,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:ade8c5cb6fdff10b686e55ca2c39ea4f94c66cd16f3ac7691dfff84140ca6532","observation_id":"fcbf7481-a563-4ee6-a647-5048a5bc8b76","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"The diverse environments multi- channel acoustic noise database (DEMAND): A database of multi- channel environmental noise recordings,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:bee23b9fe71bc5a70dc82db588f3f329530c79a969620814c77f72e41695c084","observation_id":"320a8621-46b7-4b0d-8d90-173f4644e06e","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":"1809.00496","doi":"10.48550/arxiv.1809.00496","metadata_source":"pith","pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":"cs.CV","work_id":"2f4e32b3-48a5-4b83-946d-739ea8df5168","year":2018},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:0a7a1a525d01f4b7ea5b15eec26054df2d169063f1776d40cad417c68acb6061","observation_id":"63597d9c-061d-4644-930c-d95d8a30ea95","resolution":{"observed_at":"2026-07-03T22:49:01.382024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"NTCD-TIMIT: A new database and base- line for noise-robust audio-visual speech recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:00c6d724cd5173852a1faaee79693d73b57cb11e8862c9ed340cb70ab214b683","observation_id":"7016b475-36d9-4462-bdd4-24d74b2ec68b","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"SDR–half- baked or well done?","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:5a88a6106f008cf572c901a49c0a4b14dc0cba1be8cba59272fba095b23c042d","observation_id":"709ebb50-95b1-4e58-b620-921464db7ada","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Performance measure- ment in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:b3562e354b69cd58467bdc45ae45069320a8d12fdf492c521483906fbb2ce4b2","observation_id":"bcd495df-920c-485f-85e3-ddb03a86f8fc","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"Perceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:a329dd4a176b1442d3a3b1102ff0eae51f5e2095a229ce583c1c78ac190b775e","observation_id":"272ef1c0-95a9-4e6f-a1f0-8d00467d0975","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T23:17:45.299833Z","title":"An algo- rithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T23:17:45.299833Z"},"links":{"citing_paper":"/paper/2606.23712"},"observation_digest":"sha256:c3991d3aa05e5257f7fad84e53f68d4a51b7df1f03b67a23efbaed6794d738c3","observation_id":"0983f300-b362-4d03-a785-f905f04a78b2","resolution":{"observed_at":"2026-06-26T23:17:45.299833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.23712","last_updated":"2026-06-16T06:39:04Z","latest_version":1,"primary_category":"eess.SP","snapshot_observed_at":"2026-08-16T06:09:24.142701Z","submitted_at":"2026-06-16T06:39:04Z","title":"Audio-visual Contrastive Alignment for Diffusion-based Visual-conditioned Speech Enhancement"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":29,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2606.23712."}