{"as_of":"2026-08-17T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7920b68258357dcaada9fb37e7c9d39cd586ddad2b8e64a0bb6a3a399b1270cd","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:40:09.564250Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:39:50.277622Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15294","snapshot_observed_at":"2026-08-02T19:39:50.277622Z","title":"Memo: Attentional momentum for real-time audio-visual speaker extraction under impaired visual conditions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.01530","last_updated":"2026-06-29T12:25:41Z","snapshot_observed_at":"2026-08-14T11:16:25.245165Z","submitted_at":"2026-03-02T07:00:48Z","title":"CueNet: Robust Audio-Visual Speaker Extraction through Cross-Modal Cue Mining and Interaction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T19:39:50.277622Z"},"links":{"cited_paper":"/paper/2507.15294","citing_paper":"/paper/2603.01530"},"observation_digest":"sha256:8379d067dcbcee4943e353228cd97ea8c48c580b7466477cee871d330dcc0d3d","observation_id":"a093622f-23ed-4eee-b9d4-df82da779cc2","resolution":{"observed_at":"2026-08-02T19:39:50.277622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15294/citation-record","integrity":"/paper/2507.15294/integrity","json":"/paper/2507.15294/citation-record.json","paper":"/paper/2507.15294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.175918Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.175918Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:9cfd669f98a959df803e858a4b72563c24a03f9dfde8170911d69d3a204007e0","observation_id":"83c6922e-33a6-4d1b-9c21-65841d11fc41","resolution":{"observed_at":"2026-08-06T15:40:09.175918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.181286Z","title":"The cocktail party phenomenon: A review of research on speech intelligibility in multiple-talker conditions,","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.181286Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:04a2f8c415280fc8db16dc445e908bec7ba9aef2f988ed3a9796b7cda484227b","observation_id":"744f2f48-ebd7-4a45-8006-d2f53eb17f8b","resolution":{"observed_at":"2026-08-06T15:40:09.181286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.944318Z","title":"Seeing to hear better: evidence for early audio-visual interactions in speech identification,","venue":null,"work_id":"b01507e1-8851-41e9-a5c6-3f623b704429","year":2004},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.186675Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:23c64793d44870702ffaf00af68e0a1e15e6e1e2adebdb512a12b499aeb8fef3","observation_id":"8b3c2740-4d0c-4fe9-9692-f331dc2aa051","resolution":{"observed_at":"2026-08-06T15:40:10.949415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.927895Z","title":"Visual contribution to speech intelligibility in noise,","venue":null,"work_id":"a2afff33-9a7f-49cf-bcfd-2a8d38332ac8","year":1954},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.191605Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7f7f323b6c260c80f5344c75251461a0a8ca2b334ade8275cb274eca8a0475c1","observation_id":"95ec1176-f5ff-4daf-aed3-5b0f40666070","resolution":{"observed_at":"2026-08-06T15:40:10.932674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.909988Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"468ebd1a-82aa-4e16-b9d4-3c5de9b4dc70","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.196835Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:34e5f058b8a3ab2f8b181d603adef1cc46234423f0a4efb8a84d78046134a279","observation_id":"4ff5073d-3358-4e53-8caa-ed50b21744a5","resolution":{"observed_at":"2026-08-06T15:40:10.915156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.878758Z","title":"Usev: Universal speaker extraction with visual cue,","venue":null,"work_id":"0241c5c0-f2ec-44b6-9462-311f20b1c2c7","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.201540Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:00080f7cb140e42559ebb23db2738febafc499e93ad4b623bb8e233e63b3a900","observation_id":"2763e41b-075b-4632-925b-f5e4921a5a8c","resolution":{"observed_at":"2026-08-06T15:40:10.885618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.862375Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"83f33b65-a0b7-4383-b007-49fed8676503","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.207358Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:38394728bceb116aa5bd0f46e39f8205d681ad79a264ac42bea54bfa9f88ddb3","observation_id":"d1c517a4-72d4-4dbd-b3a0-a2c100695cab","resolution":{"observed_at":"2026-08-06T15:40:10.866995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.212164Z","title":"Neural target speech extraction: An overview,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.212164Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:03b49662cd4343eb0293be531d2403cbf217680384fd92bc1d87c52615a37fb0","observation_id":"094b854b-5973-4c6b-a35e-cf83b49c2596","resolution":{"observed_at":"2026-08-06T15:40:09.212164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.837387Z","title":"An overview of deep-learning-based audio-visual speech en- hancement and separation,","venue":null,"work_id":"09137df7-b0b5-4b2a-bf5e-f383e9a851b9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.217781Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:dd59f8d0a14b9a546fa29d25a8d21bde80f0c9b11789b55b1a082108cf6c8582","observation_id":"a76edd7b-75fe-4c81-b09d-a2a30fc5197c","resolution":{"observed_at":"2026-08-06T15:40:10.841856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.821601Z","title":"PIA VE: A Pose-Invariant Audio- Visual Speaker Extraction Network,","venue":null,"work_id":"7cac7411-f91b-4eb6-951a-ee67fde4e854","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.222557Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d7f68c5cf538220c1b0f303f9f508d5eefd39fd405d0a66eabcf74f77f837fcf","observation_id":"1a4b2d8f-8080-4e8e-a875-1c91d982f1bd","resolution":{"observed_at":"2026-08-06T15:40:10.826667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.804506Z","title":"Speaker extraction with co-speech gestures cue,","venue":null,"work_id":"d17ed1ac-85f9-457c-b0cb-602f7563ab94","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.227254Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7166a2e18c03a8411de77afc0227cfc17201632e3b626dcb10d4abc727cb3fb8","observation_id":"7d13eadd-9117-4305-83c8-634b94bccd40","resolution":{"observed_at":"2026-08-06T15:40:10.809836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.787534Z","title":"Rethinking the Visual Cues in Audio-Visual Speaker Extraction,","venue":null,"work_id":"20dc8f8b-f8c1-4527-89ad-90d7e07f623f","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.231505Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4945db6570956e54da2f9a5c3f3fcb5f0516e6e85c26463725213cefbab08983","observation_id":"0f02fc49-23af-4400-a7a3-c539854bd177","resolution":{"observed_at":"2026-08-06T15:40:10.792840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.762362Z","title":"FaceFilter: Audio- Visual Speech Separation Using Still Images,","venue":null,"work_id":"ef41a563-44bb-4dea-9c0e-cdd27c13f59b","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.235980Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:166ac5a0fa7fe5cb61c1c07f4df78aa8e53e1b4708a63ac214a010884c027316","observation_id":"302839d1-bece-43a4-8150-2868d3c52695","resolution":{"observed_at":"2026-08-06T15:40:10.767074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.746819Z","title":"c 2av-tse: Context and confidence-aware audio visual target speaker extraction,","venue":null,"work_id":"62c54e5b-b043-498d-a3d0-5396c1812ae6","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.239987Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f5b951df3be704065d7826bab1f2fdb3acb58b696720595939d715718d7d0580","observation_id":"91365b9e-2036-43e3-b47e-3086683cfa8c","resolution":{"observed_at":"2026-08-06T15:40:10.751607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.731807Z","title":"Incorporating linguistic constraints from external knowledge source for audio-visual target speech extraction,","venue":null,"work_id":"c092e8a7-092b-4fc9-a1aa-6c3373182568","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.244151Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c5bd41da06668172738cf8b7165d4a5792d272a7ee63690f4fbfebf2ee0559c2","observation_id":"0a5ad71e-687a-4064-b397-262808e4d4ae","resolution":{"observed_at":"2026-08-06T15:40:10.736790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.716856Z","title":"Iianet: An intra- and inter-modality attention network for audio-visual speech separation,","venue":null,"work_id":"27e5f2cb-812c-4e95-9d76-ff961e329946","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.248745Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:66a3de1daa6b525ed9b860d9773d27acee474e39f91871e2801e8992cc69ee60","observation_id":"982b878b-e97d-4872-a5db-3910f7170acb","resolution":{"observed_at":"2026-08-06T15:40:10.721532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.700027Z","title":"Hearing lips in noise: Universal viseme-phoneme mapping and transfer for robust audio-visual speech recognition,","venue":null,"work_id":"4a5b7ba3-e628-4573-875a-8ab3f2b7a01d","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.253262Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:97208a621893e86a91c5d0c4590ff0bf32697c440149d367a9c174d5ee07a47a","observation_id":"68eefdee-0a10-4910-844e-7f8f666b21d1","resolution":{"observed_at":"2026-08-06T15:40:10.704696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.683030Z","title":"Diarization is hard: Some experiences and lessons learned for the jhu team in the inaugural dihard challenge","venue":null,"work_id":"fc4aea89-7cc7-48b6-8e5b-bc934367db7f","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.257996Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:70e29a8a2226070e565a58508053187fc8bc086079217eb76e4f620308b4f4d8","observation_id":"5516288b-28fe-4e07-9780-6485d57fdb4e","resolution":{"observed_at":"2026-08-06T15:40:10.688983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.667533Z","title":"Noise- disentanglement metric learning for robust speaker verification,","venue":null,"work_id":"6b06fdb2-900f-4e7e-9374-eefc1fe50b59","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.263291Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:985d8ccd47e1cf8c63dc06fbb44af9ab7116d73fb9a41d03edb0723ad4e955e1","observation_id":"251799e1-7c01-4669-abea-64bcb8f411b9","resolution":{"observed_at":"2026-08-06T15:40:10.672219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.651551Z","title":"Momuse: Momentum multi-modal target speaker extraction for real-time scenarios with impaired visual cues,","venue":null,"work_id":"e69c06b1-da1c-4890-9b23-8682848f1762","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.267901Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:cbe18457959fabcf6aa15f2b495a58ad15530626f19e04b059236fac9286a186","observation_id":"9b109bc0-8f1d-4e45-9b0c-b6a4cc57e48f","resolution":{"observed_at":"2026-08-06T15:40:10.656814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.635786Z","title":"Ravss: Robust audio- visual speech separation in multi-speaker scenarios with missing visual cues,","venue":null,"work_id":"7121078f-75ce-4f7a-b274-6f84b327a785","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.273119Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d215e689e699fb17a907eed7a8016f05161a1cb152e7af31f8ac298d2a3eb70a","observation_id":"0cb45b8b-12b0-4d2d-bc15-9b7e1d9cb579","resolution":{"observed_at":"2026-08-06T15:40:10.641107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.616778Z","title":"Switching variational auto- encoders for noise-agnostic audio-visual speech enhancement,","venue":null,"work_id":"22823589-a1cc-4315-a422-4b4a32bb05ec","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.277199Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:8742bf7ad492eabe22a93a8b538a0127fbb2d6e34d817d58d257324fa0c508ed","observation_id":"ca417b6c-9d8f-497e-817a-1d9c3321d122","resolution":{"observed_at":"2026-08-06T15:40:10.621867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.600910Z","title":"Robust unsupervised audio-visual speech enhance- ment using a mixture of variational autoencoders,","venue":null,"work_id":"2d1c631f-1a1e-4ad5-8da5-f987e5eb3c8f","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.281465Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6236d09113bf04f80a322be740371251d1b66d449a6d6dde8c8cf8393f57064a","observation_id":"d4283792-3a6a-4479-af6c-1321dd6c1cc4","resolution":{"observed_at":"2026-08-06T15:40:10.606055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.585979Z","title":"Time-domain audio-visual speech separation on low quality videos,","venue":null,"work_id":"a22b2d82-edc6-41f1-9267-54955f7222e1","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.286027Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:89c9827e78b24994ac1b7d22aad8083db2b8ae4de7b3746cabcff0511f516180","observation_id":"5f16851f-04db-428a-988a-61d4a7da1a78","resolution":{"observed_at":"2026-08-06T15:40:10.590626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.569880Z","title":"Imaginenet: Target speaker extraction with intermittent visual cue through embedding inpainting,","venue":null,"work_id":"fb34618f-c334-43ad-8e36-318e0cf972cd","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.291033Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5f813ffde3fd0d29187ef9fe2877edb44ed97311c54c4784dec14cb2aca644f2","observation_id":"952af7c7-1dfe-4740-b23e-d0bd0ab8c3a9","resolution":{"observed_at":"2026-08-06T15:40:10.574988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.555205Z","title":"My lips are concealed: Audio-visual speech enhancement through obstructions,","venue":null,"work_id":"1eb8b5df-06f3-4a7e-9e96-2b0e6f1fe665","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.296351Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:aee659abf6934f15c572d24bc16a79c30d7cbf1b101b62562a962b47a4b7f170","observation_id":"e7dcd13f-e53e-4227-a762-1dd98aa07395","resolution":{"observed_at":"2026-08-06T15:40:10.559734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.540468Z","title":"Multi-cue guided semi-supervised learning toward target speaker separation in real environments,","venue":null,"work_id":"9f86a741-e573-4070-b9b3-4a3032bcbcdc","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.300822Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4ac76ba4aa033ad4920fab54fc972798b03d47fe07bc8c3bdf4ee93a4f93e465","observation_id":"6619f601-ea29-4e01-9e11-6d48e8324806","resolution":{"observed_at":"2026-08-06T15:40:10.545050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.524496Z","title":"A two-stage audio-visual speech separation method without visual signals for testing and tuples loss with dynamic margin,","venue":null,"work_id":"2c4d89a0-58d9-42b5-b671-baaebdcb2947","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.305414Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:02a8aa559e71766fb866d5a2b0969773974bf7a3ed7ef80986b8e6ef3d44c091","observation_id":"f4f9bccf-176a-4260-a95b-6ca2b83a4649","resolution":{"observed_at":"2026-08-06T15:40:10.528996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.508783Z","title":"Cross-modal speech separation without visual information during testing,","venue":null,"work_id":"3dedebdc-765c-4d19-aad6-33ee4893b2eb","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.311071Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:83b9fa5b6165fe374f9f6065fcf65c5399deecb1c1fb8da8db3987d885bbbb10","observation_id":"84bce1f1-23d6-4331-9ed0-991756082d7f","resolution":{"observed_at":"2026-08-06T15:40:10.513641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.493402Z","title":"Robust audio-visual speech enhancement: Correcting misassignments in complex environments with advanced post-processing,","venue":null,"work_id":"85186f03-1a35-43b3-94d0-6b16db882143","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.317501Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:011e1353f639223307005aeb033c6c8b85dd41275c9d473002882b91132d9b4f","observation_id":"d62436f8-6c39-4acd-acbb-d67d25f39ccc","resolution":{"observed_at":"2026-08-06T15:40:10.498357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.478044Z","title":"Cocktail party listening in a dynamic multitalker environment,","venue":null,"work_id":"4c13fef3-1ade-4faf-8ffd-61f9f16fa107","year":2007},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.323438Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b3786371bd67336895e5b57f461a1e6d2645e008581fe040b00934be77faa537","observation_id":"c459807a-0a79-4ed6-8058-0cea66615d59","resolution":{"observed_at":"2026-08-06T15:40:10.482734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.462265Z","title":"The advantage of knowing where to listen,","venue":null,"work_id":"9efcf818-193b-4e22-8282-1f04aeadcff9","year":2005},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.329382Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:28c0301db7a4ddd43a2b6e4de587c347305fe60a00b19129a95263254942ad58","observation_id":"e408aa7c-a002-478f-a24e-080c71069d95","resolution":{"observed_at":"2026-08-06T15:40:10.467314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.444434Z","title":"Object continuity enhances selective auditory attention,","venue":null,"work_id":"6a42bbff-ac7a-441e-9208-3b8303653bd1","year":2008},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.334812Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:1c3c0f2efe2b906537cade3aa0c3088424bedb3fe2db72197e735493bd956edc","observation_id":"c7f82ef1-b792-452b-a6db-e60f3923d14c","resolution":{"observed_at":"2026-08-06T15:40:10.450245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.427031Z","title":"Enhanced learning through multimodal training: evidence from a comprehensive cognitive, physical fitness, and neuroscience intervention,","venue":null,"work_id":"0ce359dd-e4a8-4667-9ddf-0f27ed87db0a","year":2017},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.339775Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b1bae86bda3f61ae8fdde99baafd25252659652e69af19e18e7ea76088b1f389","observation_id":"67e2d8c8-66db-4084-b3cc-1a7574113c4e","resolution":{"observed_at":"2026-08-06T15:40:10.432061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.409111Z","title":"The important role of contex- tual information in speech perception in cochlear implant users and its consequences in speech tests,","venue":null,"work_id":"2be9d682-ae40-40ab-b0ab-41e857ef1b97","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.344866Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:aaf175ad39b8219dca535d64812c8c5ada46168a22b1b15f2ab93feae4b9cbca","observation_id":"c202bef3-25b1-4d8c-a92a-f2e3d8b3cbbe","resolution":{"observed_at":"2026-08-06T15:40:10.414053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.389405Z","title":"Attention and working memory in human auditory cortex,","venue":null,"work_id":"e07ae768-8fab-4e96-b0cf-e92f90ffea09","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.350053Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:dc12cc10a7adee9c854320cd89f00233b83e3092424d9bcc4a1c43d4371e92b4","observation_id":"92d5150e-1fa1-4fa2-8fe1-bc72d4bc2acf","resolution":{"observed_at":"2026-08-06T15:40:10.395278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.372461Z","title":"Interactions between attention and working memory,","venue":null,"work_id":"49badd16-8a84-4741-bd81-04ce370f95cc","year":2006},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.354448Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:eb5b934ffabf5ed355b27288ec6ebf0444b0b2b6210f36518556f455ad6de979","observation_id":"877109a9-6ee5-418f-aefb-59121d7b42b2","resolution":{"observed_at":"2026-08-06T15:40:10.377778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.356439Z","title":"Look once to hear: Target speech hearing with noisy examples,","venue":null,"work_id":"62d13a52-c164-4ac5-a29a-7b9521f78d09","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.358543Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:507b0d9af6436f3982a6bddad2f29947f3c4ad8ee67f0ea0cd2357923906d690","observation_id":"f1508676-d493-4fde-b68c-adfcae7d7c55","resolution":{"observed_at":"2026-08-06T15:40:10.361411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.362651Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.362651Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:fa3042668767348000409b792d72de156ddfbc089dfdda4cc454f7b8969374b7","observation_id":"e077f5c0-d99c-48aa-9f92-fb7421d248c6","resolution":{"observed_at":"2026-08-06T15:40:09.362651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.327584Z","title":"Multimodal speakerbeam: Single channel target speech extraction with audio-visual speaker clues","venue":null,"work_id":"c001a608-3f77-493f-a47b-a25e6aaf90ac","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.366891Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b864d824d69f2a743989b83c8d5f168de133a93c6784ae4c7fac5adbf9825fb5","observation_id":"d6d0b610-dd7f-440e-bebd-a6e46823b311","resolution":{"observed_at":"2026-08-06T15:40:10.332485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.305034Z","title":"Memory networks,","venue":null,"work_id":"1634c8fb-f933-451e-b6f7-b67f327126c3","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.371554Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:2bd307b08523a11a94b4ab0b8208ccae0d9490394ab337e599e0e9c9a9949996","observation_id":"5987cf6c-44af-40fa-a653-65ff48ffcdec","resolution":{"observed_at":"2026-08-06T15:40:10.311379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.282279Z","title":"End-to-end memory net- works,","venue":null,"work_id":"e726c16f-573c-424c-bc84-7ff16786685d","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.377652Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:18fb0fa8bb05cfcb2089f7e9c489cfb1cac5f841ac314c1673fd760654001232","observation_id":"3b1f9cce-ca92-414a-97b1-3694b4dd8106","resolution":{"observed_at":"2026-08-06T15:40:10.289641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.262391Z","title":"Unsupervised feature learning via non-parametric instance discrimination,","venue":null,"work_id":"1f89d4d2-f915-4574-bcf9-643521bb251d","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.382343Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4b548ce55de815e9fd6519f316a59eaf3760bfbaa3b7bc73fa320bd99e39bf15","observation_id":"c9af338d-836f-4736-ac78-904d87b15541","resolution":{"observed_at":"2026-08-06T15:40:10.268598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.245141Z","title":"Cromm-vsr: Cross-modal memory augmented visual speech recognition,","venue":null,"work_id":"c1fcd196-a4ee-4172-a2a1-30972cf597ea","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.386674Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:45ef4d3ebf2bfedd62a01752e509e35534f9d0612efd19246b61b5a8738a1591","observation_id":"91992967-d5e3-4a92-b2e2-d45a6a180914","resolution":{"observed_at":"2026-08-06T15:40:10.250036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.230411Z","title":"Multi-temporal lip-audio memory for visual speech recognition,","venue":null,"work_id":"fe6a32e5-fa74-477b-85fa-2c8fb166f207","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.391493Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:18a69136372dee1ce26d139cdce698580277d3bd8c4c508805020f4b825ffc59","observation_id":"f400ee2c-ab6b-4fc8-8a4a-bb3348d44d10","resolution":{"observed_at":"2026-08-06T15:40:10.235219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.214896Z","title":"Multi-modality associative bridging through memory: Speech sound recollected from face video,","venue":null,"work_id":"8d272187-94d6-4dd8-ac3f-65ed595f2db9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.395575Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6a11e6459e03e4548767745107cdd3ef01e3e5a3ab0765b8deecce77da5744ac","observation_id":"3d307f7b-3734-4902-b509-f0f6e5b525b0","resolution":{"observed_at":"2026-08-06T15:40:10.220095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.196743Z","title":"Akvsr: Audio knowledge empowered visual speech recognition by compressing audio knowledge of a pretrained model,","venue":null,"work_id":"bd26d194-f0c0-47e8-bee6-c0d63f490baf","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.400260Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:280f98399d746f3ae855a671302d7fe31091ca9bd0b069279e3734f1c7e5bedc","observation_id":"b7540409-2519-41ea-b221-7034dc95db8b","resolution":{"observed_at":"2026-08-06T15:40:10.202608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.179633Z","title":"Distinguishing homophenes using multi-head visual-audio memory for lip reading,","venue":null,"work_id":"954682dc-b035-4b35-81b8-e1d360b04028","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.405373Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f19f907baba7577f0b2081afbbe308c100dd59bc658f0af2d5c25c368908cf78","observation_id":"62dbf9dc-1e99-402c-a311-d97e8e29a2b3","resolution":{"observed_at":"2026-08-06T15:40:10.184305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.161939Z","title":"Speech reconstruction with reminiscent sound via visual voice memory,","venue":null,"work_id":"0a4b3ba4-67ac-40f1-9483-3981107760c8","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.409884Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:4d9905e61ec01b0c8ca2b19516d8180a354d05d6aaebb7a361d4b4fff6a759c8","observation_id":"8b8a75df-6b28-4901-82c0-914c3a569f20","resolution":{"observed_at":"2026-08-06T15:40:10.166533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.146857Z","title":"Modeling attention and memory for auditory selection in a cocktail party environment,","venue":null,"work_id":"efdb184f-c7bb-48fb-85da-69f4c41e8bf4","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.414371Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c03c5165bfcbcb5c677e728671310c5e6e9df5439b5fa9bb913e9e4e2e92df4d","observation_id":"aec87788-c5ef-4974-a09f-11d8b2aa3a8e","resolution":{"observed_at":"2026-08-06T15:40:10.151632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.130123Z","title":"Explicit-memory multiresolution adaptive framework for speech and music separation,","venue":null,"work_id":"d66f6583-b375-4c6c-922b-984887f0c3ad","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.419236Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6a270ab652d248f0d08b1fafe276c387c81eefb625873f6dea2dfc84009acac6","observation_id":"4057b1ff-ab00-44c2-a304-2d26fb5eb04f","resolution":{"observed_at":"2026-08-06T15:40:10.135206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.114139Z","title":"On the effectiveness of enrollment speech augmentation for target speaker extraction,","venue":null,"work_id":"40aeab7f-f55b-4d90-b3d6-2cc44ed1720f","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.423757Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:da1cc874b8956ebfdc2dfe274e407d75b1662076206937f7854f52c1d6e36b5c","observation_id":"f8dedcdf-0717-4d31-ace6-d546dc222950","resolution":{"observed_at":"2026-08-06T15:40:10.118919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.097808Z","title":"Selective listening by synchronizing speech with lips,","venue":null,"work_id":"f8ee122f-b3e8-4b94-a540-57516025ca73","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.428367Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c942c4f5129a6aa13201c25418ae5f18c365ff0669121c7b517c76f935e2ddd6","observation_id":"09f89054-bda5-48b8-8c9f-f5e021deb3c4","resolution":{"observed_at":"2026-08-06T15:40:10.102594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.081136Z","title":"Robust Speaker Extraction Network Based on Iterative Refined Adap- tation,","venue":null,"work_id":"26137920-c1e3-45c4-a636-f6ff5c9076d9","year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.432582Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:cc7cddc74a1b2e8161b7a47f045d6fa09744c7508fdda2a31f00540ac0442a44","observation_id":"02d088bf-9e49-468c-b71e-80c73883c938","resolution":{"observed_at":"2026-08-06T15:40:10.086812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.064557Z","title":"Listening and group- ing: an online autoregressive approach for monaural speech separation,","venue":null,"work_id":"b9ef645a-e152-4be2-8fc8-dc2aba587610","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.437077Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:deb9a3dbeebe7dc8eb622531c02b7b5fc2eba2467002e65580e64bf668e101f2","observation_id":"7752d5ec-a8d0-4ad4-b71a-94b4668935d2","resolution":{"observed_at":"2026-08-06T15:40:10.070125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.049149Z","title":"Source-aware context network for single-channel multi-speaker speech separation,","venue":null,"work_id":"ad4bdee0-3c6c-4275-a758-094751916965","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.441118Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:51ef6ee5ef444400c6fda88f3aabba774852778f3d7738de4f68dac29fd5a570","observation_id":"ec8da356-41c7-4aa4-ad74-9509c544109d","resolution":{"observed_at":"2026-08-06T15:40:10.053802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.032595Z","title":"An online speaker-aware speech separation approach based on time-domain representation,","venue":null,"work_id":"10752c6e-285e-484e-87fa-258a04a5f9c1","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.445488Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:a8312dab830ee7d87ebe53953192832067f0fe6cf9523fd4a8933579446b5362","observation_id":"7b63a849-45b7-4346-b50a-5dfc98bd0baa","resolution":{"observed_at":"2026-08-06T15:40:10.037326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:10.015823Z","title":"Iterative autoregression: a novel trick to improve your low-latency speech enhancement model,","venue":null,"work_id":"f2e9a97e-0ce1-486e-acd8-f59bf41fa753","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.450282Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5b49c91c5771f37acad0388bae32e4d5aaf5fa729dc1c498f6e59de59ed23320","observation_id":"c75e5f9b-344c-48e1-a81c-cbb23b9a1946","resolution":{"observed_at":"2026-08-06T15:40:10.020906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.998954Z","title":"Neuroheed: Neuro- steered speaker extraction using eeg signals,","venue":null,"work_id":"a9f6a258-3b80-4124-a4e2-a004dee1140b","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.454651Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6c3d50d09668fdcf6a48f5539ba04a286449be55d5ec95b9bda28085393573f0","observation_id":"f3f3203c-8165-4df5-8d2f-c873e09cbeab","resolution":{"observed_at":"2026-08-06T15:40:10.004328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.980069Z","title":"Neuroheed+: Improving neuro-steered speaker extraction with joint auditory attention detection,","venue":null,"work_id":"9ee0d673-2cfc-434b-b993-e39e0af2324b","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.458874Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6bdff8869aedc74523aabbb1381078ccd523b57062346ece6d7aa86053801301","observation_id":"e6b96c13-e4cd-4786-a305-f25608f9ce1e","resolution":{"observed_at":"2026-08-06T15:40:09.985128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.964002Z","title":"Paris: Pseudo-autoregressive siamese training for online speech separation,","venue":null,"work_id":"e0b40232-6619-4233-b129-33d32be637eb","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.463998Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:3dd37e5a3a9f0fec57afdb98bf3226fd14ab5e04ac02a364a3eb4e7ed329d646","observation_id":"0f2bcac3-be4f-490a-ab12-cecd3933a5e9","resolution":{"observed_at":"2026-08-06T15:40:09.968849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.943578Z","title":"On- line Audio-Visual Autoregressive Speaker Extraction,","venue":null,"work_id":"6e335ca4-863d-45aa-8e86-00f72adc1b65","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.469257Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c13f4cd4c378064d99d0231dde0890365ca00455a6f7f393dbe8b6db00e96ff3","observation_id":"900d7c57-838a-4484-a067-9c545a703533","resolution":{"observed_at":"2026-08-06T15:40:09.949809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.473959Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.473959Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6f903b79d08589bba83611a36d6d71401b35db7bd79b3aeb983d6171322f64e3","observation_id":"d6aa6f40-20ba-4b58-94f3-1292d36b9aab","resolution":{"observed_at":"2026-08-06T15:40:09.473959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.910551Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"f9017207-e632-4fc8-8e03-c67b5d62c1bd","year":2020},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.478541Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:3103f1c7d88d0b168c1dd73d9b514156e3343f1b8374bb0835a739f74303857c","observation_id":"81286334-2444-45bf-baeb-f40273a994ad","resolution":{"observed_at":"2026-08-06T15:40:09.916620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.892508Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"2d89eaf4-9929-4060-a8d4-bec61f2651ad","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.483332Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7bbe35fd121a5d8e41f73513b3460dd92d2bfb184acc9b56df6543425592c7f6","observation_id":"f360c19f-93a5-4926-8a80-b8ebe629387f","resolution":{"observed_at":"2026-08-06T15:40:09.897397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.488014Z","title":"Curriculum learning,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.488014Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:01d969826ea13b2a2b61624a11c15c3c1eccdc70f04219ff816ceacb6b9b3ef8","observation_id":"a5e18d5e-3975-41f5-83d8-e7782d961065","resolution":{"observed_at":"2026-08-06T15:40:09.488014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.492392Z","title":"A learning algorithm for continually running fully recurrent neural networks,","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.492392Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b05400c1d5506f3410aa1a95b986562aac399fb0cf6839368ea2bc1c46991f1c","observation_id":"c59cc09d-4efc-4930-8960-00e534280cab","resolution":{"observed_at":"2026-08-06T15:40:09.492392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.853328Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks,","venue":null,"work_id":"62e3ac87-3768-4753-a16b-38e5d39710b7","year":2015},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.497009Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f0defbf2237d73b839cae6561047c7358db9ac1504633695ffb87370065e5b7a","observation_id":"3b0191e3-e40d-42e9-88a2-1557279844d5","resolution":{"observed_at":"2026-08-06T15:40:09.858309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.837219Z","title":"Delving into high-quality syn- thetic face occlusion segmentation datasets,","venue":null,"work_id":"3801c3e4-9f2e-4d06-98ad-70b451766a56","year":2022},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.502291Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ec3f770605a8d5551cf34a50eae2ce66e2ada4e438627a03df5db1f9900e07e3","observation_id":"17078865-8ccd-4862-b091-1f5803386d60","resolution":{"observed_at":"2026-08-06T15:40:09.842492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.818585Z","title":"Watch or listen: Robust audio-visual speech recognition with visual corruption modeling and reliability scoring,","venue":null,"work_id":"f9dee7f3-9a64-4352-9b64-35d4e2ef0d7b","year":2023},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.506931Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:2ef8aeda5af449ee63ea7415a0fda0ee599e1aa2fd64c530771bde631de7c62f","observation_id":"ac2c226e-f775-4761-9c08-30a9a67f8a2a","resolution":{"observed_at":"2026-08-06T15:40:09.825636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.801074Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":"39c2a9f7-b971-464d-80a5-cf8e1c3e1c8e","year":2018},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.511270Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:6072227c189bd9b19b60cb41ca56465a2c1291b54fdb734ec54653687da7ea02","observation_id":"a38afe9a-a0f5-4d0f-b894-fb657b1d27c7","resolution":{"observed_at":"2026-08-06T15:40:09.806766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.782165Z","title":"Avhumar: Audio-visual target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"0934fd4f-8bc6-432e-b38f-1c725745cf29","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.515654Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f6aff8bead5d5aa5cd96d9201f67641c8999d4865ccf98495b06ddd21308dec4","observation_id":"60b84ecc-6bd7-4797-a666-4cc5be932f54","resolution":{"observed_at":"2026-08-06T15:40:09.787987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.761612Z","title":"Target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"193c219a-e26c-4e60-9dbc-59232c6ebf48","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.521222Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:b2d42afe529abe1626633d9b9d989534563d980d5b9fe51ae155dc408e6a344a","observation_id":"7e5d0481-f3bb-42df-8a8c-4fe34c912811","resolution":{"observed_at":"2026-08-06T15:40:09.766513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.744856Z","title":"Sdr–half-baked or well done?","venue":null,"work_id":"599eba8d-f1d4-420d-b992-4dfa5d83e9fb","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.525852Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:87d0f01808d7b24d5a6e82b5f461250bcb600027d8c8c4a1caf95310cca3eda8","observation_id":"89aae3a2-1857-492b-bb66-7adf0a6cd7da","resolution":{"observed_at":"2026-08-06T15:40:09.749611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.727808Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"57dc7143-6c8b-49cb-a2ac-28a5208927b7","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.530574Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:c1dd04c79b38321fcb935c60b9ac4daec69232b4fd9bf4f0ef928074a8491129","observation_id":"03e57a72-d5f5-46cf-8ff2-e8a5e8c6791b","resolution":{"observed_at":"2026-08-06T15:40:09.733522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.707630Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":"f8dcb293-0975-47b3-97fa-73448fcc4637","year":null},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.535064Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:7033292698f16d517550c62f7a2fc5693231d9426e424e36fbf427fca1a871d8","observation_id":"c9560885-5aa4-4169-8ffe-8241c468c3dd","resolution":{"observed_at":"2026-08-06T15:40:09.713313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.686981Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"c6dc01c9-0343-4b9d-81a7-17fb4f4b3fca","year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.540459Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:f92dc073f9d2f5c7db681287fc6ab09ff63b10410df0da746b947d1b1a560e37","observation_id":"f1c2c8e9-7380-4dc0-aab9-0c7cabd69ed8","resolution":{"observed_at":"2026-08-06T15:40:09.693485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.545087Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.545087Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:5363676dd07537449a9ab33b36554a39d12323025a9aec4cf4ff2d25eb88075f","observation_id":"7cf1d4a5-6276-456f-9ad5-bdb419330ec7","resolution":{"observed_at":"2026-08-06T15:40:09.545087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.549514Z","title":"Music source separation with band-split rnn,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.549514Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:9b41c6258caf04622c97d914b352de6028cf9fbd5c8db7952a4e7fbb71a28483","observation_id":"4453c919-dd08-4af9-a213-2da60ed02d89","resolution":{"observed_at":"2026-08-06T15:40:09.549514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.644169Z","title":"Wesep: A scalable and flexible toolkit towards generalizable target speaker extraction,","venue":null,"work_id":"a9e83b6c-d050-4d02-85a3-6574811d8106","year":2024},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.554592Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:ea6c02b9c464e6e402e8ace8718df9defd3825d8ee80209d5a02d591eb0e4b35","observation_id":"88f831c1-baf9-4a3f-9125-e6d48eb7bc4d","resolution":{"observed_at":"2026-08-06T15:40:09.648914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.624269Z","title":"Audio-visual target speaker extraction with selective auditory attention,","venue":null,"work_id":"536b4d44-09bc-4dde-853a-4c5362e8d917","year":2025},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.559373Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:e28c2963a7ed4f397508ff5f2361c1eca3896f7f4a90146cef9ef6fb859028a9","observation_id":"8e34c688-aeea-432b-b1fc-c5cc47cd47d5","resolution":{"observed_at":"2026-08-06T15:40:09.631585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:40:09.564250Z","title":"Attention is all you need in speech separation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:40:09.564250Z"},"links":{"citing_paper":"/paper/2507.15294"},"observation_digest":"sha256:d2454a9450c194e79b9d7216310ee80d0c1990bb7a5b501b07e91e8f3aa4eb15","observation_id":"aa5cd0ee-cf22-4bee-8798-2d7dd572e36e","resolution":{"observed_at":"2026-08-06T15:40:09.564250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15294","last_updated":"2026-06-09T11:53:10Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T09:54:02.290461Z","submitted_at":"2025-07-21T06:49:12Z","title":"MeMo: Attentional Momentum for Real-time Audio-visual Speaker Extraction under Impaired Visual Conditions"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":72},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 1 inbound Pith citation observation for arXiv:2507.15294."}