{"as_of":"2026-08-14T23:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cd7354db1e4dd7872b1d487b3ddc1d4bd9e968b93573973c377011b887c35b1","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:11:17.649998Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:11:17.344737Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T20:11:18.008189Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"cited_work":{"arxiv_id":"2608.09288","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.09288","snapshot_observed_at":"2026-08-11T20:11:18.008189Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","venue":"cs.SD","work_id":"0cd8c13c-6fc2-4a31-b81b-b5f9517fb1ab","year":2026},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.344737Z"},"links":{"cited_paper":"/paper/2608.09288","citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:ab8b5560da1991d6538946f78c778c48f530a938cf5083193103f5062a48f623","observation_id":"25cdecb6-faa7-4f86-8dc5-9fec91c89c82","resolution":{"observed_at":"2026-08-11T20:11:18.015625Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2608.09288/citation-record","integrity":"/paper/2608.09288/integrity","json":"/paper/2608.09288/citation-record.json","paper":"/paper/2608.09288"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.844551Z","title":null,"venue":null,"work_id":"f8cf459a-f8be-4a58-9dc5-7d6882115c71","year":null},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.333888Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:25c74d5526cdee672d9f700aa6c4795a8be6d418b8102f1e31ed01e7000fbc6d","observation_id":"fc445400-b253-469c-9d90-86a84a66ae2c","resolution":{"observed_at":"2026-08-11T20:11:18.851075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"cited_work":{"arxiv_id":"2608.09288","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.09288","snapshot_observed_at":"2026-08-11T20:11:18.008189Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","venue":"cs.SD","work_id":"0cd8c13c-6fc2-4a31-b81b-b5f9517fb1ab","year":2026},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.344737Z"},"links":{"cited_paper":"/paper/2608.09288","citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:ab8b5560da1991d6538946f78c778c48f530a938cf5083193103f5062a48f623","observation_id":"25cdecb6-faa7-4f86-8dc5-9fec91c89c82","resolution":{"observed_at":"2026-08-11T20:11:18.015625Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.822648Z","title":"As illustrated in Figure 1, the framework comprises three components","venue":null,"work_id":"a93fc648-a8c9-431b-b979-f7531013be90","year":null},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.354145Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:78edda61b2defaa6dae5762ab400c75de59a70e3682f6a7926585395ab4782dc","observation_id":"a91461eb-53fb-4c65-a36f-5604f41ea4e0","resolution":{"observed_at":"2026-08-11T20:11:18.829440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1450.7692","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:17.965535Z","title":"Each GPU processes a batch of 2 three-second segments","venue":null,"work_id":"9c317af7-5a30-42b4-810a-aa9619f0b76a","year":null},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.363813Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:b0a4a15bfef5f28fe0e93c3b470c3c37193e9eab91d9e9c52b28ece68426d63e","observation_id":"66e2904c-72a7-44cf-942e-09160a56e2a8","resolution":{"observed_at":"2026-08-11T20:11:17.979671Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.801883Z","title":null,"venue":null,"work_id":"fc9cb716-4e03-44d6-9174-3013977b843b","year":null},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.375982Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f9298040e0e89d76b285ba0c937840c6fbff514062333b04efe4f3658db61d9c","observation_id":"75eea7ea-8709-4388-8bb1-1e3ec166f98e","resolution":{"observed_at":"2026-08-11T20:11:18.809126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.781522Z","title":"Conv-TasNet: Surpassing ideal time- frequency magnitude masking for speech separation,","venue":null,"work_id":"d6123194-b990-4355-969a-e1281ead89bc","year":2019},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.384365Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f73373ef314f27e5d781fe59d368b2d584a6a87a39098ccae31a17c4d2a39f6f","observation_id":"83323de6-c4ea-426e-952e-d990f5845e29","resolution":{"observed_at":"2026-08-11T20:11:18.787881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:17.392252Z","title":"Permutation invari- ant training of deep models for speaker-independent multi-talker speech separation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.392252Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:4d61677c3f7df5dc23de8765aaeacacbc10e18ff175283c7a3d1ca596ef8a2d5","observation_id":"115e74d8-e6ce-45f5-a227-59b676efcbc3","resolution":{"observed_at":"2026-08-11T20:11:17.392252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:17.401926Z","title":"Deep clus- tering: Discriminative embeddings for segmentation and separa- tion,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.401926Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:fd0b5223694be7c09f68b00520b8ea80ece0497f5becf43af12e79b16a35bb35","observation_id":"e8a1fcb8-2e8a-470c-b1f9-6c4cf83f3fd5","resolution":{"observed_at":"2026-08-11T20:11:17.401926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.726929Z","title":"Ps4: Proxy-supervised joint training for real target speaker extraction,","venue":null,"work_id":"6590acde-f800-4e14-852b-c413ff0ce7f4","year":null},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.408624Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:1da7c1bb609efe5a437d57e599e04157b20c76a50707e322253a204a8659997f","observation_id":"57262555-fa9a-4c87-9042-8815d639a69f","resolution":{"observed_at":"2026-08-11T20:11:18.733292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:17.468283Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.468283Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:098c48ee15562429167bc2ba23a5dbb6488708ea48526eb2aa6b0a5d084348f1","observation_id":"6bb8351a-2688-4b3f-a87f-a37375ae6694","resolution":{"observed_at":"2026-08-11T20:11:17.468283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.706862Z","title":"Looking to listen at the cock- tail party: A speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"f8d17e99-7464-4160-9516-4ec9c8b06776","year":2018},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.426200Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:d8a914fa120d0a16486e26db1395bc3984a4eadaffcb27d9361d8abfa9491c97","observation_id":"5e71a295-8a89-476d-bb03-6856ba402afb","resolution":{"observed_at":"2026-08-11T20:11:18.712514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.688646Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":"bcc6e3e9-e976-41b1-aebc-2debba70fd39","year":2018},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.436060Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:3766ef9de374e6b8097f58168140570e3d32e0d06b3402b9f2c9ea2ab208405f","observation_id":"96b59652-e80d-4c7c-8076-0f3dc98bea56","resolution":{"observed_at":"2026-08-11T20:11:18.693661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.667803Z","title":"The fifth CHiME speech separation and recogni- tion challenge: Dataset, task and baselines,","venue":null,"work_id":"aaaafaa1-03fe-458f-9fc5-cd059019869d","year":2018},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.447103Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:267072d72136c02d56ca3f75b2b9a9a2e20e72895fb82bfe45db40ff1a59ee81","observation_id":"992753b2-b15a-4bfb-b1e8-9c9bbfe2381a","resolution":{"observed_at":"2026-08-11T20:11:18.673732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.646163Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"ae6110e5-610e-47b8-bcad-5e2fee0a946f","year":2019},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.455231Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:2cc558f4f559e2e85644aceecafe3370dc3b029d3d125c0f572e5926c43bfdd4","observation_id":"3f8a515a-c3a2-4c16-84e0-966d748376b7","resolution":{"observed_at":"2026-08-11T20:11:18.653153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.625476Z","title":"Dual-path RNN: Efficient long sequence modeling for time-domain single-channel speech sepa- ration,","venue":null,"work_id":"bd0b4e51-7c62-4d44-852a-027b29cb6791","year":2020},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.461553Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:ed579705ee3c0d7ea49b14b1e181a8886bacb14717caf42a0b68978184003116","observation_id":"d71aea48-a37b-45d7-8ae9-f0a815ffa552","resolution":{"observed_at":"2026-08-11T20:11:18.631428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.437190Z","title":"Tiger: Time-frequency interleaved gain extraction and reconstruction for efficient speech separation,","venue":null,"work_id":"adb81049-9a0d-412e-accc-0a4570f61583","year":2025},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.522082Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:eba92e1b148419a08a237fe668427ae490254c221e186ed273014e48587dd51e","observation_id":"253453a5-10ff-4d60-a783-d704dc62d06e","resolution":{"observed_at":"2026-08-11T20:11:18.443078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.587975Z","title":"The AliMeeting corpus: A multi-modal meeting corpus,","venue":null,"work_id":"d3193dc5-682c-46f7-add3-d3215566027b","year":2022},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.473940Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:a731c929fb39cc873256f9d8b4b6c90a4a5d7d420c6e0f4eee045a6c17358d24","observation_id":"d2608980-c4e3-496e-b4f6-25dfff961332","resolution":{"observed_at":"2026-08-11T20:11:18.595219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.566479Z","title":"MISP: A multi-modal interactive speech process- ing system,","venue":null,"work_id":"21531008-f999-447d-8273-b8502590556e","year":2021},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.483059Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f3e3c68120f02e35aafce42a9c14282024f916a853f953c5759ca60e6d7c0acf","observation_id":"fd809e29-c043-4c39-9c87-f7b69a1723b6","resolution":{"observed_at":"2026-08-11T20:11:18.572367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.542574Z","title":"AISHELL-4: An open source dataset for speech separation, diarization and recognition,","venue":null,"work_id":"16ac0a17-a35f-404c-8f3d-abe6cc117e08","year":2021},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.494065Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:d8ef8abfeba003d9b73be1d41c5fe88e613f266c91fee799c78885eda19a142b","observation_id":"3550d6bb-89c4-4abc-b4b9-12293e97788f","resolution":{"observed_at":"2026-08-11T20:11:18.549663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.509537Z","title":"Pyroomacoustics: A Python package for audio room simulation and array processing algorithms,","venue":null,"work_id":"d9505a0a-24b1-4385-8f82-3a791405707e","year":2018},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.501409Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:49fe33d5345e15c23a6984f0230d11cac27477b82ba589f1bb8e80f77453d984","observation_id":"7d840653-aa0e-466d-96f8-e7feaa5005db","resolution":{"observed_at":"2026-08-11T20:11:18.517409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.475537Z","title":"A tutorial on hidden markov models and selected applications in speech recognition,","venue":null,"work_id":"8356e123-83fe-4e86-8c20-cacff68f233a","year":1989},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.508585Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:88a923593eebbe935ecfa5123884815e993a67e6de88311c5c8d59d6b7359c8f","observation_id":"493c7620-d86e-44ec-b7c9-abc3c55dfb05","resolution":{"observed_at":"2026-08-11T20:11:18.485875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.316621Z","title":"WeSpeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"c4abe365-9a76-415c-bfa9-7de54d8c6d20","year":2023},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.570686Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:01cdeb9cad8cdcb16828f4309f25e16fddbbe379303189b853580f104ff6dc5c","observation_id":"17111b39-8046-4a0f-80e2-243022073d20","resolution":{"observed_at":"2026-08-11T20:11:18.324783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.414986Z","title":"FunASR: A fundamental end-to-end speech recog- nition toolkit,","venue":null,"work_id":"0e9188d1-0ca6-45da-9813-ae3a1e96e45f","year":2023},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.530326Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f7c9b417fe3fb4d82307e266699caf570173f7c9ffd805a7e97d331cdf99c762","observation_id":"0091574d-79e4-4869-bf45-747464705955","resolution":{"observed_at":"2026-08-11T20:11:18.422808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.385540Z","title":"Room impulse response generator,","venue":null,"work_id":"fa0c1cbc-25aa-4667-a65d-067403d16eec","year":2006},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.537504Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:6cd62da8e3f66bbba963370c5efa4cf423d6c85715e9bef13c5e87c9695dd1f5","observation_id":"10891722-f7dd-4c05-974e-b8140a655b55","resolution":{"observed_at":"2026-08-11T20:11:18.394748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-08-14T22:25:51.884597Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-11T20:11:17.545140Z","title":"MUSAN: A music, speech, and noise corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.545140Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f382ac5cbf3c47cee8552210929d9a096d93d75805e056902a568053641d924d","observation_id":"4c61cefb-b562-47f4-adbc-271e34d9e0f3","resolution":{"observed_at":"2026-08-11T20:11:17.545140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:17.553114Z","title":"Overcoming catastrophic forgetting in neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.553114Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:1568f3f4a637f52796b07b04b534c669726917c24db92d03ebfb66c4f5846aa9","observation_id":"d49fe0c5-3e18-47d9-bfa1-bbf262df550c","resolution":{"observed_at":"2026-08-11T20:11:17.553114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.340994Z","title":"SDR— half-baked or well done?","venue":null,"work_id":"abe98d77-e328-4a7b-87ba-8cb052d9a0c9","year":2019},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.561434Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f3d423f552a3d8e63cf5ce13e4aa2954e50e5e1ad6551acdc9f5c44f2a9ff60d","observation_id":"cd12754a-dbc8-4030-b37a-449c3f8bbe28","resolution":{"observed_at":"2026-08-11T20:11:18.350823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.174433Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"110d6ef5-f8ed-4a70-8e43-9cbe9a3f9465","year":2016},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.607522Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:33f612658ebf5f63633f26daf172ae9986ea505bd3b2b44aa33535d8a03f0935","observation_id":"80506bb9-9d1d-4262-9005-0f181893d814","resolution":{"observed_at":"2026-08-11T20:11:18.182349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.283643Z","title":"An al- gorithm for intelligibility prediction of time-frequency weighted noisy speech,","venue":null,"work_id":"9eb2b57f-eb73-49af-a180-48d19b056626","year":2011},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.576768Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:6a6130bffc07a8110ccce35ac893ff1f9d41496342a81232f072752705c9ca51","observation_id":"4621ba01-de89-496c-b84a-3f695fe93e4c","resolution":{"observed_at":"2026-08-11T20:11:18.292973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.251510Z","title":"Per- ceptual evaluation of speech quality (PESQ)—a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"93437772-781d-4237-9f21-2f02b43fcb28","year":2001},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.583386Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:6b32f656f0f5472f982c38989909a6425af122e5a2ec3de65e958986ec0a7563","observation_id":"37610fde-13b3-4199-b35a-cf321ca2121e","resolution":{"observed_at":"2026-08-11T20:11:18.259065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.225188Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS challenge 2022,","venue":null,"work_id":"1274aee6-672a-4cb7-b6a8-6e7900d99db5","year":2022},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.589283Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:426734acde89577d76aece0e784f4c48307153089d3a5a43bc0862dcb8b12176","observation_id":"c499a89d-fa14-4693-a02d-f02d1cfabeca","resolution":{"observed_at":"2026-08-11T20:11:18.233862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.199044Z","title":"CN-Celeb: A challenging Chinese speaker recognition dataset,","venue":null,"work_id":"19d65c6e-a8f0-4f4f-ba74-84332a387afd","year":2020},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.594834Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f8b2aa1616805bd6bf9dc26a4393b5acc91738d84bf9d544edfb23a52fb3903c","observation_id":"38e85c96-5376-4b67-a3d7-376e9a4f4a18","resolution":{"observed_at":"2026-08-11T20:11:18.207925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-14T04:53:10.712854Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-11T20:11:17.601296Z","title":"LatentSync: Taming audio-conditioned latent diffusion models for lip sync with SyncNet supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.601296Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:d84116796176095a9240815dc82f838a78ab9a1e0e8247ba7f3d48c9cd1d6cf4","observation_id":"bdaae359-ff6e-41a6-a41f-d9f99bc321c9","resolution":{"observed_at":"2026-08-11T20:11:17.601296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.050331Z","title":"DNSMOS: A non-intrusive perceptual objective speech quality metric to evaluate noise sup- pressors,","venue":null,"work_id":"66502418-b781-4252-b450-cca68921058b","year":2021},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.645482Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:b096d2ddd269465b852c36dfce2f8beb437083a960146bd9d1faacdbbf514a5d","observation_id":"98347166-25ef-4caa-be48-4d0cea703896","resolution":{"observed_at":"2026-08-11T20:11:18.056216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.155741Z","title":"Perfect match: Improved cross-modal embeddings for audio-visual synchronisa- tion,","venue":null,"work_id":"0dfe29b0-2f5b-4219-9d57-e12669d7e609","year":2019},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.613825Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:9d6053710a0fee1750ca6f99cefbfcb91308983fd13b9281f10a76eee17e0955","observation_id":"bf281f55-d30e-403c-91c5-025d59aa647a","resolution":{"observed_at":"2026-08-11T20:11:18.161583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.136140Z","title":"How far are we from solving the 2D & 3D face alignment problem? (and a dataset of 230,000 3D facial landmarks),","venue":null,"work_id":"d7f8456a-cfa2-4475-a534-f221c066d692","year":2017},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.622982Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:dae1bd2e21923557743cd44e5d5dd2651e05027071623236a46c4a3ff0a3be56","observation_id":"09a28137-d12b-41e7-b2de-3002d75bf121","resolution":{"observed_at":"2026-08-11T20:11:18.141478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.114861Z","title":"SEGAN: Speech en- hancement generative adversarial network,","venue":null,"work_id":"334dd500-b0ac-47b9-b8d5-9432bbcd5dc9","year":2017},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.629274Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:c7a541e386ffd39cf1b302e5cc20e0de83d920e383fbae024224dfa4316b5fa9","observation_id":"756fc988-95c4-4891-bd19-25e58cd4a8ae","resolution":{"observed_at":"2026-08-11T20:11:18.121792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.094920Z","title":"MossFormer2: Combining transformer and RNN-free recurrent network for enhanced time-domain monaural speech separation,","venue":null,"work_id":"46f3372c-9d03-415e-ba13-1b4bae8b5655","year":2024},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.636161Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:226063fb5966a7085a5a6a497590882f6d0b22ac48b66d0917c1c082a8e7f531","observation_id":"2e55f7fb-f54a-4281-959d-9e2b2fe8e520","resolution":{"observed_at":"2026-08-11T20:11:18.101171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.071197Z","title":"Recommendation ITU- R BS.1770-4: Algorithms to measure audio programme loudness and true-peak audio level,","venue":null,"work_id":"ab552b7e-3b98-48e6-b02f-e92136a6c1b5","year":2015},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.641112Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:f368dd562fe80e77338567450b08d28862e2d37cf4075d41b04bc99d65fc3e61","observation_id":"37ccb782-15f1-44b6-aa2c-b3cf76884711","resolution":{"observed_at":"2026-08-11T20:11:18.078598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:11:18.031508Z","title":"Adam: A method for stochastic opti- mization,","venue":null,"work_id":"143165a6-be71-4f8a-aec4-3645d4accb80","year":2015},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.649998Z"},"links":{"citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:a47720af618a147e4f4631226b3a5ced9c97dcc10e81d7f5b1986a9d9fdf0c79","observation_id":"58be2944-db1e-452e-a1ce-174982bea642","resolution":{"observed_at":"2026-08-11T20:11:18.037042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.08111","last_updated":"2026-07-09T04:51:11Z","snapshot_observed_at":"2026-08-02T16:21:04.923669Z","submitted_at":"2026-07-09T04:51:11Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2607.08111","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.08111","snapshot_observed_at":"2026-08-11T20:11:17.767198Z","title":"PS4: Proxy-Supervised Joint Training for Real Target Speaker Extraction","venue":"cs.SD","work_id":"ecabd2a6-8116-429a-8576-22adcb8acf5a","year":2026},"citing_paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T20:11:17.417789Z"},"links":{"cited_paper":"/paper/2607.08111","citing_paper":"/paper/2608.09288"},"observation_digest":"sha256:e7ecd1bc11adae997e1c99ec9262156377ebf0b42d4882eff7deb6f73781b43f","observation_id":"3a2c279c-6dfb-463f-8a7b-c2b2b003c788","resolution":{"observed_at":"2026-08-11T20:11:17.777692Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09288","last_updated":"2026-08-10T08:41:28Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T23:20:14.233963Z","submitted_at":"2026-08-10T08:41:28Z","title":"DAVE: A Decoupled Audio-Visual Enhancement Framework for Real-World Speech Separation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2608.09288."}