{"as_of":"2026-08-10T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:83fb61f0842660bb679694d524d75917b7d4244cbe50ab055bfe29fd52e253a0","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:08:17.836014Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:41:16.865462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T18:41:18.737055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2506.00466","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00466","snapshot_observed_at":"2026-08-06T18:41:18.737055Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","venue":"eess.AS","work_id":"86ba7c4d-69fc-44ed-ba56-a0ecb583846f","year":2025},"citing_paper":{"arxiv_id":"2507.07526","last_updated":"2025-08-11T07:29:51Z","snapshot_observed_at":"2026-08-10T01:59:43.183551Z","submitted_at":"2025-07-10T08:15:03Z","title":"DMF2Mel: A Dynamic Multiscale Fusion Network for EEG-Driven Mel Spectrogram Reconstruction","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:41:16.865462Z"},"links":{"cited_paper":"/paper/2506.00466","citing_paper":"/paper/2507.07526"},"observation_digest":"sha256:1c6c6639c426f499d22c064da6aa689b60650c6a23828d1fd3fa9193fe5edd68","observation_id":"8de67a4d-dd98-4d1f-9a7e-c8cfb58efa2a","resolution":{"observed_at":"2026-08-06T18:41:18.762933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00466","snapshot_observed_at":"2026-08-03T07:24:44.110448Z","title":"M3ANet: Multi-scale and Multi- Modal Alignment Network for Brain-Assisted Target Speaker Ex- traction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.20542","last_updated":"2026-05-23T03:34:27Z","snapshot_observed_at":"2026-08-10T04:54:04.705798Z","submitted_at":"2026-01-28T12:37:20Z","title":"Decoding Speech Envelopes from Electroencephalogram with a Contrastive Pearson Correlation Coefficient Loss","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T07:24:44.110448Z"},"links":{"cited_paper":"/paper/2506.00466","citing_paper":"/paper/2601.20542"},"observation_digest":"sha256:2bb1997bdd4d81b51adf2843b130583d449e05b734dd475f1345db1df96ed246","observation_id":"36a42793-abee-433f-8157-6c307e1077df","resolution":{"observed_at":"2026-08-03T07:24:44.110448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00466/citation-record","integrity":"/paper/2506.00466/integrity","json":"/paper/2506.00466/citation-record.json","paper":"/paper/2506.00466"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.506979Z","title":"Electrophysiological correlates of semantic dissimilarity reflect the comprehension of natural, narra- tive speech.Current Biology, 28(5):803–809,","venue":null,"work_id":"6c782b97-7cb2-4f8c-8e32-07a83f69cefd","year":2018},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.230964Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:b0a12c4fc7d0c5470698a042d554bfd800013a84b43a4fce275b0296bd4ce6bb","observation_id":"bc195b6e-d5d0-4f63-a9d0-04ac866c9326","resolution":{"observed_at":"2026-08-07T12:08:24.666999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01673","last_updated":"2025-01-03T07:27:51Z","snapshot_observed_at":"2026-08-10T01:59:31.221169Z","submitted_at":"2025-01-03T07:27:51Z","title":"Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2501.01673","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01673","snapshot_observed_at":"2026-08-07T12:08:18.058919Z","title":"Improved Feature Extraction Network for Neuro-Oriented Target Speaker Extraction","venue":"cs.SD","work_id":"86cd8fc5-4ca6-429e-a339-0420581869cb","year":2025},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.691413Z"},"links":{"cited_paper":"/paper/2501.01673","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:4326fd0832c852962dbe8df897966b5588198b8dee58cca827bf5c6c0fca0a86","observation_id":"8f307be1-86c4-49ac-8956-6f9759ca9460","resolution":{"observed_at":"2026-08-07T12:08:18.114926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.657822Z","title":"L-spex: Localized target speaker extraction","venue":null,"work_id":"8419301d-cd53-4de5-bcad-978ecf8d0ad6","year":2022},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.922931Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:6f765764f0690ad4422939ef0495328e5c187c05aef66df4150fabd6618b24a9","observation_id":"13523b52-39f6-431a-b171-19ca9d351e34","resolution":{"observed_at":"2026-08-07T12:08:23.756034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.731889Z","title":"The cocktail party problem.Neural computation, 17(9):1875– 1902,","venue":null,"work_id":"aa494a80-80c5-4ef8-a51d-5f40c887278d","year":2005},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.321264Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:3edfd28a7ffd60202a21d6ec797d7ccd58cf496dd80da5e7505818cccbe6aa80","observation_id":"e2974a40-42d1-4de0-8110-e608a5038a5f","resolution":{"observed_at":"2026-08-07T12:08:22.856502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.353195Z","title":"Speaker-independent brain enhanced speech denoising","venue":null,"work_id":"6f4d6828-6da9-4a87-bef5-07fa5d58ad1e","year":2021},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.542157Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:14b88ed0df28b05494ccc34a7742fb85dde2f4d6677fded9968a32426da8d4d6","observation_id":"df764bc2-ffa9-4846-8928-5a6b8931a09f","resolution":{"observed_at":"2026-08-07T12:08:22.420567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.841483Z","title":"Cross-modal global interaction and local alignment for audio-visual speech recognition","venue":null,"work_id":"34879e3a-acef-4d22-8596-59759010b4bb","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.738422Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:d5fa5a00d1a21d78555621537b52b5a0282aef30e3625881dcb6d00cd11deef9","observation_id":"3c2dcafd-2de0-422b-af07-0b1cda3acfb3","resolution":{"observed_at":"2026-08-07T12:08:22.007943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.659181Z","title":"[Le Rouxet al., 2019 ] Jonathan Le Roux, Scott Wisdom, Hakan Erdogan, and John R Hershey","venue":null,"work_id":"3dd21fc0-f1d1-4404-9e9e-a7bf03393969","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.828302Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:632f966f07c74783f9d1d0f621118c1653d251d7bac7b0166a7ace39508a1a1d","observation_id":"5fa6fbf7-6719-4168-b5c3-cc96e9102fa3","resolution":{"observed_at":"2026-08-07T12:08:21.729131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:15.910755Z","title":"Align before fuse: Vision and language representation learning with momentum distilla- tion.Advances in neural information processing systems, 34:9694–9705,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.910755Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:6c0930ec2b3e2b9776d51d5ef7962493e8371478ebfc20ee6323464ee13958c5","observation_id":"efeb095b-13d3-4666-b5b3-3425874acfd2","resolution":{"observed_at":"2026-08-07T12:08:15.910755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.332688Z","title":"Audio-visual active speaker extraction for sparsely overlapped multi-talker speech","venue":null,"work_id":"fa53a02e-2ae8-45c0-b27f-4986df1de006","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.002599Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:9f85bc444ed75450a7e56315fa57bc99041b73a40e7d11b917f3945703a4da53","observation_id":"2efd5f25-00e7-4d3f-8874-eb720ed719a3","resolution":{"observed_at":"2026-08-07T12:08:21.476889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:21.112220Z","title":"Av- sepformer: Cross-attention sepformer for audio-visual tar- get speaker extraction","venue":null,"work_id":"61d67dff-3c29-4513-8731-de963156dca8","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.099123Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:69caa3d5bb032364dfc472137dd78654bffdb726a1fd991530eda18333930677","observation_id":"51088153-38b9-44cf-9d43-d86685d3973a","resolution":{"observed_at":"2026-08-07T12:08:21.207261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.917128Z","title":"Development of the audi- tory system.Handbook of clinical neurology, 129:55–72,","venue":null,"work_id":"64e5deca-175b-4183-81ef-5010c6e9f510","year":2015},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.177957Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:18af26cd387b66b95203b0e9273012b910349e38bd19762730084bacf9d68222","observation_id":"bafb6e57-f5e0-45ae-8f6c-cb2825084cc9","resolution":{"observed_at":"2026-08-07T12:08:20.995877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.514306Z","title":"Dual-path rnn: efficient long sequence modeling for time-domain single-channel speech separation","venue":null,"work_id":"2ebf6a3b-e78d-4043-92f1-bec39c5d6b43","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.365027Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:497ec6667fd6dea6216230d7cc124bd505d22b2580ccc39add51f96acb6baf7d","observation_id":"5bd4c207-95ca-4561-bd42-5119b2fd12e1","resolution":{"observed_at":"2026-08-07T12:08:20.631601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.330478Z","title":"Dbpnet: Dual- branch parallel network with temporal-frequency fusion for auditory attention detection","venue":null,"work_id":"b8de22c2-6819-4f43-9c58-e64263b372c8","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.461928Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:6a4b789bdf74b41abd1ad8b5cd8e3dbd1b65c6ffb22efeacf2f33722b7a2ecd0","observation_id":"1556424d-5a68-4f54-a3d0-172c329858fa","resolution":{"observed_at":"2026-08-07T12:08:20.412865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.142787Z","title":"Attentional selection in a cocktail party environment can be decoded from single- trial eeg.Cerebral cortex, 25(7):1697–1706,","venue":null,"work_id":"907dea6a-af83-46ce-97ee-38b1f46fc4bb","year":2015},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.586298Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:2cb57c70b76cbc701d76d8b606ea16f7b2122e047fe2af3ca54858f3febf20f3","observation_id":"37e4535f-4d26-4e5c-9eeb-a1b405a74090","resolution":{"observed_at":"2026-08-07T12:08:20.240052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.965493Z","title":"Neural decoding of at- tentional selection in multi-speaker environments without access to clean sources.Journal of neural engineering, 14(5):056001,","venue":null,"work_id":"795985e2-3a99-4f2b-a94c-329f3dce84a8","year":2017},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.677988Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:165e614e3b571bea94bf69277c1834cb07791c9dbd9bc43913c439255c082aef","observation_id":"6046fe9f-d1f6-4977-8a76-b8d3c9047317","resolution":{"observed_at":"2026-08-07T12:08:20.058858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.787811Z","title":"Neu- roheed+: Improving neuro-steered speaker extraction with joint auditory attention detection","venue":null,"work_id":"cc5b9b6a-9fc4-4e96-abdd-448fb18065fb","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.758386Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:1875c1cb18211001e3056dd63f24206e07129c4793556283005729a4d70cbd9d","observation_id":"b3e6997e-0ba2-4970-ac42-73566d32e77a","resolution":{"observed_at":"2026-08-07T12:08:19.870687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.597400Z","title":"Tf-nsse: A time–frequency domain neuro-steered speaker extractor.Applied Acous- tics, 211:109519,","venue":null,"work_id":"226cbc79-8866-4432-8cde-5497d3eb7a38","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.857130Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:b4156853d14a1f0a0918f20b60e4559ecfb9f347509e6e0f2a2f8f1880689145","observation_id":"20c99bcf-0126-4174-a528-1a75a08b5db6","resolution":{"observed_at":"2026-08-07T12:08:19.706750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.381334Z","title":"Phase space graph convolutional network for chaotic time series learning.IEEE Transactions on Industrial Informat- ics,","venue":null,"work_id":"6346382b-d19c-4361-8112-a6fe4e003635","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.950800Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:343dbdb93dfe0f6458ecb3935117e00f169c71e97bc855934b48ba9847ec900d","observation_id":"6acfd61d-a7aa-40dc-a6c3-b881a3eb6a0e","resolution":{"observed_at":"2026-08-07T12:08:19.492949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.218615Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs","venue":null,"work_id":"6ea8c25d-a95b-4730-9be9-f4e9f5d6dd5a","year":2001},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.035539Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:3b64d5721019dce6d7c238864ce9f9a338e0916666e684b2b5b8619a3f27413a","observation_id":"4beca81b-dc3b-475c-aa27-943dd8141bc5","resolution":{"observed_at":"2026-08-07T12:08:19.286102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.053600Z","title":"An algorithm for intelligibil- ity prediction of time–frequency weighted noisy speech","venue":null,"work_id":"f353bcee-72d6-4506-9ad0-0b953dfeb399","year":2011},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.277497Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:6efce8e3530f8cf15ac1a39557c509372b7ba8a79226120104d8e5b4b7ba0e3a","observation_id":"8e2a4f39-bf0f-4ec0-ae23-f64f8f361103","resolution":{"observed_at":"2026-08-07T12:08:19.136099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.886567Z","title":"A study of multichannel spatiotemporal features and knowledge distillation on robust target speaker extraction","venue":null,"work_id":"7ddf0daf-ebf7-4079-ae7c-6ac58082e14f","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.447655Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:cc0518d4a3a457b06aaafe00862c9d29e673cf9893c71247fd3ff7454be7f4ed","observation_id":"3cb4f928-39ea-4f02-acbd-1f4a5fbd31e0","resolution":{"observed_at":"2026-08-07T12:08:18.950548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.767146Z","title":"Spex: Multi-scale time domain speaker extraction network.IEEE/ACM transactions on audio, speech, and language processing, 28:1370–1384,","venue":null,"work_id":"c9c4624c-b8ed-468a-9ee8-480c918ec0fb","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.503332Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:65c3a4840a0cc1330c3774efa4aa282adfce9d7adec5387ea31abb188b5a7380","observation_id":"ff249c62-b548-44b8-aa3d-a2595cb51d0a","resolution":{"observed_at":"2026-08-07T12:08:18.820826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11181","last_updated":"2024-11-18T16:25:53Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T01:51:29Z","title":"DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection","version":2},"cited_work":{"arxiv_id":"2410.11181","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11181","snapshot_observed_at":"2026-08-07T12:08:17.928333Z","title":"DARNet: Dual Attention Refinement Network with Spatiotemporal Construction for Auditory Attention Detection","venue":"eess.AS","work_id":"c7356eb0-3296-48b1-bfa1-38c4a06274fb","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.613996Z"},"links":{"cited_paper":"/paper/2410.11181","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:ca412db8a4577fde271ed913bb43d2cafa3dea0c8ca7254c0858fd91b2d5d26e","observation_id":"3ad76a10-e7c1-4e4d-8d48-72455b9e78c3","resolution":{"observed_at":"2026-08-07T12:08:17.955113Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.638209Z","title":"Basen: Time-domain brain-assisted speech enhancement network with convolutional cross at- tention in multi-talker conditions.Interspeech 2023,","venue":null,"work_id":"0c14d44b-c5ed-411c-a6f9-5d0c3c26845d","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.692399Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:8391f4feaba685dd6bb8852e5e368be45fca480b3de929b1d4d1f151eb611986","observation_id":"bc8e5ec2-d71f-41e9-8950-eb2003d6de73","resolution":{"observed_at":"2026-08-07T12:08:18.705495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.495126Z","title":"Based on audio-video evoked auditory attention detection electroencephalogram dataset.Journal of Tsinghua University (Science and Tech- nology), 64(11):1919–1926,","venue":null,"work_id":"c7720a55-d2b7-4e9f-823e-f620f1ab0a94","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.749495Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:0dd0851d9028b599aec7a928cc64580b953f8b7dee5af9d63f9a77baea905f57","observation_id":"4c96733a-00b6-4f10-8b93-6354c97f32d8","resolution":{"observed_at":"2026-08-07T12:08:18.568754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:18.335744Z","title":"Neural target speech extraction: An overview.IEEE Signal Processing Magazine, 40(3):8–29, 2023","venue":null,"work_id":"5a66c495-5fde-4990-b366-94e900554e96","year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.836014Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:54e7d6fa55e6196f75ac628270a3a105f3edf4669765ee93ea8d1a3eff965e12","observation_id":"54d544ed-48a9-4f5b-b627-dfc15aff88a2","resolution":{"observed_at":"2026-08-07T12:08:18.404454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13772","last_updated":"2025-03-28T23:38:22Z","snapshot_observed_at":"2026-08-04T21:17:03.297277Z","submitted_at":"2024-07-18T17:59:58Z","title":"GroupMamba: Efficient Group-Based Visual State Space Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13772","snapshot_observed_at":"2026-08-07T12:08:17.151270Z","title":"Groupmamba: Parameter-efficient and accu- rate group visual state space model.arXiv preprint arXiv:2407.13772,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.151270Z"},"links":{"cited_paper":"/paper/2407.13772","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:fd3e1983a338c7aa24614206a45cd5063fe85199ffc8fc8a38400c3dfc77723f","observation_id":"cb6d813a-1da5-4dd1-82c2-343b6f83e2c9","resolution":{"observed_at":"2026-08-07T12:08:17.151270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.524139Z","title":"Centroid estimation with transformer-based speaker embedder for robust target speaker extraction","venue":null,"work_id":"d513941c-9c80-4965-90b4-823ae425f99c","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.440078Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:c590a1678704542364d89be69827429a523ca86797caa8daaad6234a9018867d","observation_id":"c4fc0c39-1540-4c36-83cd-f0c5369100b8","resolution":{"observed_at":"2026-08-07T12:08:22.610268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:19.029549Z","title":"Speech intelligibility predicted from neural entrainment of the speech envelope.Journal of the Association for Re- search in Otolaryngology, 19:181–191,","venue":null,"work_id":"060b59d5-441a-4ca8-861c-1d59eaa0651e","year":2018},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:17.369243Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:ee0d712c019ce29b6149179abe5aa619348906b0c2e7b4713d5b686ed97286bf","observation_id":"cc40db08-4309-4add-a24d-7547d36f37ff","resolution":{"observed_at":"2026-08-07T12:08:19.047429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:20.715000Z","title":"Conv-tasnet: Surpassing ideal time–frequency magnitude masking for speech separation.IEEE/ACM transactions on audio, speech, and language processing, 27(8):1256– 1266,","venue":null,"work_id":"5ed129c1-4216-4114-b2dd-5346ec13d408","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:16.284920Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:fe36eda7dad85c16780c0a2e9bf9a64a5bb09f73ed0111c2ed87d73e4c6995e6","observation_id":"187771db-3a3e-4b65-a4cd-ec87fac5dad5","resolution":{"observed_at":"2026-08-07T12:08:20.818684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:24.207973Z","title":"Brain-informed speech separation (biss) for enhancement of target speaker in multitalker speech perception.NeuroImage, 223:117282,","venue":null,"work_id":"dfe19f98-eeb4-447c-83ee-c06a59750d88","year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.335409Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:cbd5c533cc292a3a72780558488944ce8bc3b88f4b4e27d830e181901f9dccbd","observation_id":"493b7a6c-6905-47f2-88dd-dccd89182d9c","resolution":{"observed_at":"2026-08-07T12:08:24.313507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07284","last_updated":"2024-10-07T06:54:30Z","snapshot_observed_at":"2026-08-10T01:59:40.020150Z","submitted_at":"2023-10-11T08:17:54Z","title":"Typing to Listen at the Cocktail Party: Text-Guided Target Speaker Extraction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07284","snapshot_observed_at":"2026-08-07T12:08:15.107005Z","title":"Typing to listen at the cocktail party: Text-guided target speaker extraction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.107005Z"},"links":{"cited_paper":"/paper/2310.07284","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:46743366edd6c8e33a4d5a0db9cc768c751210503723c0a6d92dbe87babcc206","observation_id":"d0c08969-5790-4ea4-b3f3-29de1790de9c","resolution":{"observed_at":"2026-08-07T12:08:15.107005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02489","last_updated":"2024-09-16T06:35:07Z","snapshot_observed_at":"2026-08-07T15:59:26.568097Z","submitted_at":"2024-09-04T07:33:01Z","title":"NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention","version":2},"cited_work":{"arxiv_id":"2409.02489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02489","snapshot_observed_at":"2026-08-07T12:08:18.180099Z","title":"NeuroSpex: Neuro-Guided Speaker Extraction with Cross-Modal Attention","venue":"cs.SD","work_id":"384ca7e0-b2ee-4853-8e47-16b71b1f8c4e","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.465323Z"},"links":{"cited_paper":"/paper/2409.02489","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:931c81b0a7e3753240141601b16e452152495e7a94b9ebf3e9f8ba1f25053759","observation_id":"0cd41983-8063-42d2-adc1-94a39ac04e1c","resolution":{"observed_at":"2026-08-07T12:08:18.245325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:22.110190Z","title":"End-to-end brain-driven speech enhance- ment in multi-talker conditions.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:1718– 1733,","venue":null,"work_id":"3f760925-e368-48b0-bd2e-dda389262e24","year":2022},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.638340Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:a183fe70df1fd2bb2c7f553dcf04c0a26c7b18e30c5ad05a96031734f32f37aa","observation_id":"f3f7cfbf-b1ee-46ac-8306-2586aa49a79c","resolution":{"observed_at":"2026-08-07T12:08:22.213036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.331681Z","title":"Speaker-independent auditory attention decoding with- out access to clean speech sources.Science advances, 5(5):eaav6134,","venue":null,"work_id":"3c2a191f-54bd-4d3b-87f3-45bc3aa92ad1","year":2019},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.015545Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:66af4dc94f9212d958b1dc27aa629bf6738a97dd0c3843d98c85a68d5ab7d0b6","observation_id":"65930c91-b637-452e-9df8-32bf922a2c89","resolution":{"observed_at":"2026-08-07T12:08:23.495225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.026771Z","title":"X-tf-gridnet: A time–frequency domain target speaker extraction network with adaptive speaker embed- ding fusion.Information Fusion, 112:102550,","venue":null,"work_id":"d5194ba0-7daa-457f-aa34-0fe292c62f8a","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:15.228471Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:c711e6f3622c8cee93aac1d62c7efe22404c599df19106e2c2baf382e7dde111","observation_id":"f78d3635-634d-4020-9633-6f9d2e4ad98c","resolution":{"observed_at":"2026-08-07T12:08:23.157869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:08:23.946755Z","title":"Msfnet: Multi-scale fusion net- work for brain-controlled speaker extraction","venue":null,"work_id":"bcab65cc-4bce-4d7c-854e-100fc3f8cf8b","year":2024},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.580915Z"},"links":{"citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:a64e2276269e752d98af9f572f926914bd9df7e165d30254bedc3fd6a02d5e2c","observation_id":"e8195b1e-72b8-4d7c-aa33-933a0806b837","resolution":{"observed_at":"2026-08-07T12:08:24.082962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.04686","last_updated":"2020-08-18T03:03:01Z","snapshot_observed_at":"2026-08-10T11:50:41.077369Z","submitted_at":"2020-05-10T15:00:07Z","title":"SpEx+: A Complete Time Domain Speaker Extraction Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.04686","snapshot_observed_at":"2026-08-07T12:08:14.833000Z","title":"Spex+: A complete time domain speaker extraction network.arXiv preprint arXiv:2005.04686,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:08:14.833000Z"},"links":{"cited_paper":"/paper/2005.04686","citing_paper":"/paper/2506.00466"},"observation_digest":"sha256:3604636646406360836bf4d5888f3cffa3c67379f87e37aa71037d5c228ce30b","observation_id":"b3fb19f1-d6c2-4a3c-ad58-871fcf6c22aa","resolution":{"observed_at":"2026-08-07T12:08:14.833000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00466","last_updated":"2025-05-31T08:33:57Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T04:53:51.144755Z","submitted_at":"2025-05-31T08:33:57Z","title":"M3ANet: Multi-scale and Multi-Modal Alignment Network for Brain-Assisted Target Speaker Extraction"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":3,"verified_fuzzy":31},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.00466."}