{"as_of":"2026-08-17T16:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7bcb89c4c4fdd4d14601a27495768a7c70d874315d2d9165529c18131ef9efbe","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:04:31.716604Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:04:28.526024Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:04:31.829062Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2507.06566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06566","snapshot_observed_at":"2026-08-06T19:04:31.829062Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","venue":"eess.AS","work_id":"cc948c92-7ae7-40fc-b676-03bfb03d5a13","year":2025},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.526024Z"},"links":{"cited_paper":"/paper/2507.06566","citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:414237742e34bfc46a7badf4d4c56171291301b9669f28918d77ef0eeacf191e","observation_id":"f5f5636b-395b-42d6-9ec2-ed1836a61fe9","resolution":{"observed_at":"2026-08-06T19:04:31.889166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.06566/citation-record","integrity":"/paper/2507.06566/integrity","json":"/paper/2507.06566/citation-record.json","paper":"/paper/2507.06566"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:36.143480Z","title":"Humans use auxiliary information, such as spatial and visual cues as well as speaker familiarity, to selectively attend to auditory stimuli [1]","venue":null,"work_id":"7a68de7a-d2de-4fec-972a-79a45f89d0dc","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.438780Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:9b5d5571773dfc7f4bc42cdab9d8f1b073e2aafaa5c8ad81e8bca8f6ed1ee741","observation_id":"b3c7bbe7-8cd5-4329-848c-3a3f824ebf9c","resolution":{"observed_at":"2026-08-06T19:04:36.275780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2507.06566","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.06566","snapshot_observed_at":"2026-08-06T19:04:31.829062Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","venue":"eess.AS","work_id":"cc948c92-7ae7-40fc-b676-03bfb03d5a13","year":2025},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.526024Z"},"links":{"cited_paper":"/paper/2507.06566","citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:414237742e34bfc46a7badf4d4c56171291301b9669f28918d77ef0eeacf191e","observation_id":"f5f5636b-395b-42d6-9ec2-ed1836a61fe9","resolution":{"observed_at":"2026-08-06T19:04:31.889166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:35.890445Z","title":"The architecture comprises an AudioClueNet module, a VideoClueNet module, an embedding combination module, and an extraction network","venue":null,"work_id":"9fba18f3-decf-4d27-bfc2-7a472683590a","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.619912Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:9b07e9e40a467d99d720d5450eaed6c6f93d02a4426b5d005d4c3346f90f465b","observation_id":"4b9e1ac3-5e6a-4565-b09a-05a92e79abbb","resolution":{"observed_at":"2026-08-06T19:04:36.013691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:35.672397Z","title":"3 was trained using three differ- ent training strategies to study their effect on the model’s robustness","venue":null,"work_id":"dc58f95b-ae03-48f8-aa35-c7c6cd303654","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.736738Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:732b1ec82dffb78e65e3c432590bd4d1431711f05033ad4577d91fbb204c4fe6","observation_id":"2b0a58df-6125-4f35-b39a-2c240e557696","resolution":{"observed_at":"2026-08-06T19:04:35.798746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:35.462540Z","title":"Model description The basic building block of MTSE system under test is the dual- path recurrent neural network (DPRNN) proposed in [20]","venue":null,"work_id":"159f5fd6-68a3-42a6-a8c8-e820f81a56c9","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.858366Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:47b4285b7ca7934a759ccc6c3661e17c4bccc1c546a31bdf80c2481b66625f44","observation_id":"d8f53ced-b569-420d-8012-97098fbd582c","resolution":{"observed_at":"2026-08-06T19:04:35.558471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:35.005340Z","title":"Our initial experimentation showed the models to be sensitive to the normalization layers used in the DNN architecture","venue":null,"work_id":"b6475d6f-7c95-4b55-9f25-3120f815463a","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.080203Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:b343cd091b04e2d0a10ad42f895ea50df1e373868b96fda31d7c43774082c0e5","observation_id":"43779bf2-5a02-4247-a2cf-197af482189d","resolution":{"observed_at":"2026-08-06T19:04:35.119973Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.956854Z","title":null,"venue":null,"work_id":"4d997777-3a8e-4eb6-ae75-6cc8a53938be","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.182452Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:7454009779416e7217cebdf29e283736f2be85d6f8dd7611f085cd85125a1931","observation_id":"d4496882-b3c2-4409-b3c2-4ff9b4db4cee","resolution":{"observed_at":"2026-08-06T19:04:34.999737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.169059Z","title":"Usev: Universal speaker extraction with visual cue,","venue":null,"work_id":"32ce4ed5-21fa-4acb-b53a-85abee5704e6","year":2022},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.965218Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:019114101fa4bcd4363e87f3bd4fe1923719b700e20fbff737c030ca49dd979e","observation_id":"9a11ddb9-7eac-47d7-89ed-e135ddd24952","resolution":{"observed_at":"2026-08-06T19:04:34.204021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.837411Z","title":"The cocktail-party problem revisited: Early processing and selection of multi-talker speech","venue":null,"work_id":"4be56ef1-8080-48bb-b44d-fd84bd3aa516","year":2015},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.282529Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:c706c3672d8217b0d29c374381d47c7c7dd98a50765ff6aece0091226d58127b","observation_id":"eb7c28ff-8c55-4f15-85d5-d271ef7cfc85","resolution":{"observed_at":"2026-08-06T19:04:34.896402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.736619Z","title":"Single channel target speaker extraction and recognition with speaker beam,","venue":null,"work_id":"87cb3101-068f-46c4-8fdf-5573b6a5e578","year":2018},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.364193Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:7e68654bfe6a64ff9e12fe8cf7e45cd410c85cded68755b4f8f8f49e88035905","observation_id":"69977751-296b-4938-9819-bd2c7630f7d7","resolution":{"observed_at":"2026-08-06T19:04:34.794652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.645743Z","title":"Improving speaker discrimination of target speech extraction with time-domain speakerbeam,","venue":null,"work_id":"c6e520d0-0fc3-402a-ad1b-8e02024a0d3d","year":2020},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.484727Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:3ae8fdad7fd8d12e53d86529b49e9cfbc5fe6bd4183363d28330c4335d8f0214","observation_id":"b9d8668d-4ecf-4fa4-8eae-1bb253f96e93","resolution":{"observed_at":"2026-08-06T19:04:34.689464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.553219Z","title":"X-TaSNet: Robust and accu- rate time-domain speaker extraction network,","venue":null,"work_id":"103bbda3-b3d9-49a4-879b-73e70eee92ed","year":2020},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.611493Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:3aae71ced18b7373e1df130caf0165cc9f6d0c422c0ea45e73476a6fa5d34f33","observation_id":"089f216d-62a3-4e31-8c87-6a76468e0dd6","resolution":{"observed_at":"2026-08-06T19:04:34.587802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.451337Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"997ad619-1015-4525-8523-ec02735d9f71","year":2020},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.711218Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:01f94bf07722a4e3495b4b3d6d9070cd576d10f9b106d984530d3c7e7bf2541f","observation_id":"589c60fe-fc3c-4f76-9965-eb81eda70371","resolution":{"observed_at":"2026-08-06T19:04:34.505337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.365885Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"a96944c1-c7b4-4580-9433-39429f7bb880","year":2019},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.808411Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:b4a9b5fb90ca495d190a6e0753f8d2254681fad2d9caad03d981cb6e1b1606b2","observation_id":"76335c91-0715-4543-8483-70d8986113a5","resolution":{"observed_at":"2026-08-06T19:04:34.415813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.263323Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"06d64e80-8897-42a5-9032-b182e944e307","year":2021},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:29.877370Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:dbd97e6c32786a0cc7d8d8cf46cac46f69eb95248edf683c8617bd6a8e2d0c00","observation_id":"0c140bb3-f781-4e02-b8e1-db34f6dc92da","resolution":{"observed_at":"2026-08-06T19:04:34.306690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.033609Z","title":"A universally- deployable ASR frontend for joint acoustic echo cancellation, speech enhancement, and voice separation,","venue":null,"work_id":"bf905d93-8efe-4929-9f43-0c3bfe03e47a","year":2022},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.773923Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:394254708407e4acd86b51865a20fa50cd7d0fdb9b553a4657565b337f6b89e5","observation_id":"e867124a-969b-445a-bd4d-3759b391df81","resolution":{"observed_at":"2026-08-06T19:04:33.106973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:34.076837Z","title":"Multimodal SpeakerBeam: Single channel tar- get speech extraction with audio-visual speaker clues,","venue":null,"work_id":"cd95d8c6-8d5a-4c56-95c3-4eaba059aa6d","year":2019},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.061113Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:564cec3cb3f3bb7ec7bb0f014cf4baaffc9d9d4fb431f1b8b1b1c9e8caea6c2c","observation_id":"37e0dac8-7426-44fa-b2d8-c9ddd98fec6c","resolution":{"observed_at":"2026-08-06T19:04:34.129372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.977855Z","title":"My lips are con- cealed: Audio-visual speech enhancement through obstruc- tions,","venue":null,"work_id":"09167f02-c87e-4aa6-b9cd-93dcf29b6477","year":2019},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.138599Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:849d18a48d7e2763940887c76750cc5750bf04c299a9e269b7033c83d85bad5b","observation_id":"2e663395-b6bf-4442-822a-a60e879dae13","resolution":{"observed_at":"2026-08-06T19:04:34.023699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.825080Z","title":"Multimodal attention fusion for target speaker extraction,","venue":null,"work_id":"0fc9d84a-125c-49f9-ae27-b165875ace9f","year":2021},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.204098Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:cc77bb15966e9477fa1473e9f154019fe7e961ab8a3f6f55cc29d60ee6411770","observation_id":"cb1c1913-d5b7-431d-93fe-2c193154737a","resolution":{"observed_at":"2026-08-06T19:04:33.895207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.692766Z","title":"An overview of deep-learning-based audio- visual speech enhancement and separation,","venue":null,"work_id":"801be519-bca1-4dae-9320-aec6f8050f4b","year":2021},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.339631Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:d5b5ee4bb3e4590d3f6ff20a9c13e42ef5cfe74357fcd0a6ecd7dba4976223c4","observation_id":"a5b151bd-736d-4985-b74a-7bb033376187","resolution":{"observed_at":"2026-08-06T19:04:33.752065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.487281Z","title":"Moddrop: Adaptive multi-modal gesture recognition,","venue":null,"work_id":"3d9914d2-957d-43ee-aa53-8bf8266cc1c6","year":2016},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.460601Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:8d635414911ba611fb60eaffc8f917713bdc93a5ef6c64651e7d11541bdc3fd6","observation_id":"6724d629-e7b5-4f52-b762-c08f87cf91be","resolution":{"observed_at":"2026-08-06T19:04:33.555767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.329712Z","title":"Modality dropout for im- proved performance-driven talking faces,","venue":null,"work_id":"f1515ded-8ed4-4cf6-8b76-57426985f883","year":2020},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.590018Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:8ebaf001af40fd22435d729bd58d256c1baf6fafa18c9b8f1d633eccf396b1c6","observation_id":"8af16198-4809-4e05-88a0-6afd2e435f73","resolution":{"observed_at":"2026-08-06T19:04:33.395794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:33.166407Z","title":"Learnable irrele- vant modality dropout for multimodal action recognition on modality-specific annotated videos,","venue":null,"work_id":"f7209af5-28f7-4775-895f-68547f9a269d","year":2022},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.693010Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:b711f1dbbc03833df9e19132d1592a5245887889bf3cfd5563f8d4126b2042ae","observation_id":"7abef295-032d-4e16-965f-2dc171142a5c","resolution":{"observed_at":"2026-08-06T19:04:33.255162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00733","last_updated":"2023-09-15T06:15:22Z","snapshot_observed_at":"2026-08-16T17:24:17.008198Z","submitted_at":"2022-02-01T20:10:23Z","title":"New Insights on Target Speaker Extraction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00733","snapshot_observed_at":"2026-08-06T19:04:31.507782Z","title":"New insights on target speaker extraction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.507782Z"},"links":{"cited_paper":"/paper/2202.00733","citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:6cb6e3a87467e93a58fc98f3050d1a5d7de403de2355fb266b03d606cc7cb3b0","observation_id":"4a63c721-16c5-478e-a033-38feec9b9beb","resolution":{"observed_at":"2026-08-06T19:04:31.507782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.913078Z","title":"Multi- stage speaker extraction with utterance and frame-level refer- ence signals,","venue":null,"work_id":"098ba4b1-d307-409b-827c-9e15de0c571a","year":2021},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.858657Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:da4d82b9f2be1966a8f931fe9a5c00698119ad8e9bf9ccf1fedbaf2212eaa5e8","observation_id":"c3ebc68b-ad67-43a7-90c9-503d5657ccb0","resolution":{"observed_at":"2026-08-06T19:04:32.975622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.785958Z","title":"TasNet: Time-domain audio sep- aration network for real-time, single-channel speech separa- tion,","venue":null,"work_id":"54912bc3-8d35-46f0-8e0f-3cdb46241781","year":2018},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:30.988388Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:b05adcb1740c65e9edba20165f0e44dd9758d1ed3743dbb79e07451baeec2818","observation_id":"facb3b7c-3bab-4864-87d1-b872e9bf72b3","resolution":{"observed_at":"2026-08-06T19:04:32.850217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.687773Z","title":"SDR– half-baked or well done?","venue":null,"work_id":"93bd83e9-a4a0-458c-a2c7-d0068bc57b37","year":2019},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.095766Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:ae1072886a00669c86ef30e176485cf16b8c40e4f161bf829d3f82d121a194dd","observation_id":"72479576-39ad-46d6-89b4-d5b5cc3a851e","resolution":{"observed_at":"2026-08-06T19:04:32.728864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.588825Z","title":"Dual-path rnn: Effi- cient long sequence modeling for time-domain single-channel speech separation,","venue":null,"work_id":"2fa744a0-760a-407b-b0b7-af252d504071","year":2020},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.187299Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:ff4065b07c50ce4c7aeb71f12175bd7808871b4ad1c5faf56245029c54b447ed","observation_id":"09c07bce-6864-4834-8d42-672dee8ab427","resolution":{"observed_at":"2026-08-06T19:04:32.622331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.479294Z","title":"Combining residual net- works with lstms for lipreading,","venue":null,"work_id":"4399d578-77cb-4a5e-94ed-e897780176b8","year":2017},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.222323Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:c6637848a988bb2a8e24528d6c811a0bbd2cbb85e002c79d8d0709360aca2436","observation_id":"b30c94ea-a70a-4bd7-b763-553e6fd65efe","resolution":{"observed_at":"2026-08-06T19:04:32.537888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.367008Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"7c698ef3-765e-4fbe-84c8-c2288cc39ec2","year":2016},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.278099Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:8ddf602e6335554546fe96a3d19900d2ab603429baa20477717c98b646064053","observation_id":"343025d0-6147-415e-81b8-2125e2ea9722","resolution":{"observed_at":"2026-08-06T19:04:32.424559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-06T19:04:31.413980Z","title":"LRS3-TED: A large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.413980Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:0083d8e2cc4ce55bcf517ddaa04599e546dcccc3a3a10bc648f381fc7816c368","observation_id":"b9272abf-7e09-4bae-990e-c5f33dc78deb","resolution":{"observed_at":"2026-08-06T19:04:31.413980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.233586Z","title":"Adam: A method for stochastic op- timization,","venue":null,"work_id":"b742680f-f5c3-459d-a13a-92d0060c50e6","year":2015},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.567625Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:07e685de6d6ebcabee2a1851c11f29d84891565434fc530bc6a9bf136318af64","observation_id":"8a47bfce-57e9-4d7a-b72c-c28ddb18c00b","resolution":{"observed_at":"2026-08-06T19:04:32.303545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:32.096021Z","title":"Wavesplit: End-to-end speech separation by speaker clustering,","venue":null,"work_id":"ca532f17-4f9d-4820-9f28-cf183b4c6edf","year":2021},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.614386Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:70a61ce149fac7de7a944dbe6f879cf87404992c912e882b13447ebb9ed79b7c","observation_id":"5dada267-3769-4780-852e-2c6a11c20b64","resolution":{"observed_at":"2026-08-06T19:04:32.159095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:31.962016Z","title":"Conv-TasNet: Surpassing ideal time-frequency magnitude masking for speech separation,","venue":null,"work_id":"1f0a97eb-716b-4a0e-9b50-6e2345326dd5","year":2019},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.657945Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:17de2e9195a213b60a0e11cc229193bb975f3394e630c406bf736b5757b0a142","observation_id":"003b5539-8b65-403b-9361-20b4f280dca3","resolution":{"observed_at":"2026-08-06T19:04:32.028738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T19:04:31.716604Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:31.716604Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:7e987966a169858dc91dfa00ef8fe1748f0b7a7b11dcf4320556a0309f9eea55","observation_id":"c2afe8af-eead-4367-8380-18eb5a4428ea","resolution":{"observed_at":"2026-08-06T19:04:31.716604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:04:35.224252Z","title":"The inter- and intra-chunk RNNs are realized in the non-causal configuration using bi-directional long short-term mem- ory (LSTM)","venue":null,"work_id":"67cf0d4f-338c-468b-b6c8-44fb77d97120","year":null},"citing_paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction","version":1},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-08-06T19:04:28.949405Z"},"links":{"citing_paper":"/paper/2507.06566"},"observation_digest":"sha256:b5032c496fd6646921db1290531f27498efd97edad3e99c33db565ec8a545fe6","observation_id":"f91be2b0-5ace-46f4-8264-ffdeaf227828","resolution":{"observed_at":"2026-08-06T19:04:35.327944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06566","last_updated":"2025-07-09T05:43:35Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T22:33:42.079323Z","submitted_at":"2025-07-09T05:43:35Z","title":"Training Strategies for Modality Dropout Resilient Multi-Modal Target Speaker Extraction"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2507.06566."}