{"as_of":"2026-08-13T11:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e0aa380664d6d51cf626c3909812274f0011392e71fa815fb2ac6044c605f17","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:30:41.135038Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01518/citation-record","integrity":"/paper/2501.01518/integrity","json":"/paper/2501.01518/citation-record.json","paper":"/paper/2501.01518"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.819963Z","title":"The conversation: Deep audio-visual speech enhance- ment","venue":null,"work_id":"2c274f00-2136-4123-93bc-87f889f52cec","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.906332Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ddd6f3830b9fbd92dcde582d17fdef739f29e711c1992a387b30905cba502288","observation_id":"0ab3960e-a3fe-479b-b16c-aebb3609c7a2","resolution":{"observed_at":"2026-08-10T22:30:41.824149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-10T22:30:40.911436Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.911436Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:b05b5acbe304afb207bff15baec2c871f3f4a866ed3982a7cabef939e442736a","observation_id":"b5d5e497-055a-4040-86ad-48fa0db08193","resolution":{"observed_at":"2026-08-10T22:30:40.911436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.809252Z","title":"My lips are concealed: Audio-visual speech enhance- ment through obstructions","venue":null,"work_id":"94789baf-7810-4562-ad09-265f2d16c450","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.915374Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:eb386f18fe1fb25be1f9d21bf60666df6a971cbc2cb59e80e89573bf9441d62b","observation_id":"38034054-41b9-483e-9656-bf421910de83","resolution":{"observed_at":"2026-08-10T22:30:41.813131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.798373Z","title":"Self-supervised learning of audio-visual objects from video","venue":null,"work_id":"1c3e5b9a-c3b5-42ba-b0bb-87d86486b187","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.919387Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:26959fc540f87e150c5bc0a85db9a8dfa6cb76f5e756030d3737c82cc7baac7e","observation_id":"d99466b3-8a37-406c-aa62-f2b7d2139348","resolution":{"observed_at":"2026-08-10T22:30:41.802130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01599","last_updated":"2016-12-16T16:09:34Z","snapshot_observed_at":"2026-07-06T05:17:29.499249Z","submitted_at":"2016-11-05T04:05:18Z","title":"LipNet: End-to-End Sentence-level Lipreading","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01599","snapshot_observed_at":"2026-08-10T22:30:40.923188Z","title":"Assael, Brendan Shillingford, Shimon Whiteson, and Nando de Freitas","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.923188Z"},"links":{"cited_paper":"/paper/1611.01599","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ed6befa1474a141a0ae6136f0098445a75b35bf9ae2d92a13221e8228d55cbe2","observation_id":"db76f7ff-7fb8-4c11-b568-f39062179782","resolution":{"observed_at":"2026-08-10T22:30:40.923188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.787603Z","title":"Phonemizer: Text to phones transcription for multiple languages in python","venue":null,"work_id":"4637e1ef-c69b-4131-8e9e-88480aba1251","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.927322Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:42c2b83cae60259c084b33ad806ae9f9ac7b2ca68dd31babe968558a56cca7ac","observation_id":"9b8835f8-a4dd-48dd-b9dc-840c56951f08","resolution":{"observed_at":"2026-08-10T22:30:41.791554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.777194Z","title":"Audio-visual synchronisation in the wild","venue":null,"work_id":"72ae8058-4dd5-4a84-ad93-b6dc939142cd","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.931502Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9875121d60adcfee6d58c9fee16308bfa5b68a23e018e4ea74bded277e9cb6b9","observation_id":"fd460ee0-f4d2-429f-936d-921a0843a975","resolution":{"observed_at":"2026-08-10T22:30:41.780893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.766497Z","title":"Deep attrac- tor network for single-microphone speaker separation","venue":null,"work_id":"a63ff34a-53dc-4615-b4ec-b4359f151fd3","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.934940Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:d9d20be1537dae58e3019c456e0e93f2d2bd546715b9abd0b10327ea37553d18","observation_id":"afafdaec-dce2-499d-9b34-ac6934cf9b75","resolution":{"observed_at":"2026-08-10T22:30:41.770243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.755824Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"8beab5bd-a74f-4b53-a6cd-498920e3b97b","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.938885Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:4786e88f59f8bfdc1a5b3c576434a01bfd5878e99f7a7cc33f9925604d8cfc71","observation_id":"027513d9-d655-4d13-96b1-1b3ddbb520d1","resolution":{"observed_at":"2026-08-10T22:30:41.759334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.746041Z","title":"Lip reading in the wild","venue":null,"work_id":"5b4cec44-2b8e-4b50-a344-238f8e6000f5","year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.942276Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:8e092b8fcde2f06d3de80a05852277426ae3137b4e9e0126a26eec4bd12279e8","observation_id":"dcd99952-8200-4af1-b432-b440c346d91a","resolution":{"observed_at":"2026-08-10T22:30:41.749567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07074","last_updated":"2020-05-14T15:42:31Z","snapshot_observed_at":"2026-08-13T07:39:12.653212Z","submitted_at":"2020-05-14T15:42:31Z","title":"FaceFilter: Audio-visual speech separation using still images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07074","snapshot_observed_at":"2026-08-10T22:30:40.946090Z","title":"Facefilter: Audio-visual speech separation using still images","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.946090Z"},"links":{"cited_paper":"/paper/2005.07074","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:0625b8fe27f2cb1cc274f8241eaf0c094c1cb7fc6cb69fbfc49ba27b20d7ca6e","observation_id":"1f66ee20-3968-4ac0-9620-6a4d2d0c9e1f","resolution":{"observed_at":"2026-08-10T22:30:40.946090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.734954Z","title":"Real time speech enhancement in the waveform domain","venue":null,"work_id":"28b85491-932b-4c32-b05e-dcfe6e3fbfa1","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.949963Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:297ab662007b88b473d0a03661f219554933035542a73d4444da02306e8f8bd2","observation_id":"57efc268-dfbc-4605-97cc-bc7a7ed3d7bf","resolution":{"observed_at":"2026-08-10T22:30:41.738937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.13254","last_updated":"2021-04-28T14:37:48Z","snapshot_observed_at":"2026-08-10T13:57:00.836098Z","submitted_at":"2019-11-27T13:50:45Z","title":"Music Source Separation in the Waveform Domain","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.13254","snapshot_observed_at":"2026-08-10T22:30:40.953728Z","title":null,"venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.953728Z"},"links":{"cited_paper":"/paper/1911.13254","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:7b8a45fbb3ce7a9662962ab98b4ef4d80eb5c5c3e836fce199f1a9d213f96e3d","observation_id":"7181ccb4-2d5e-4513-bc3d-2092414e194a","resolution":{"observed_at":"2026-08-10T22:30:40.953728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-10T22:30:40.957623Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separa- tion","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.957623Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:34339d153638ffdae0e95c3956deddb50c9cfbfb43369e8372a33e18f00ca59a","observation_id":"b2f14a6a-a786-4146-88cb-40414f437063","resolution":{"observed_at":"2026-08-10T22:30:40.957623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.722423Z","title":"Learning joint statistical models for audio- visual fusion and segregation","venue":null,"work_id":"7a150bde-a786-4d49-8585-f403b45b0b03","year":2000},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.961532Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:234ed800601afeee17f4079f4591955ab6a2d0d5403f8911aa8cfe99a3697dae","observation_id":"4b307e38-25a9-40ea-bee5-f689fd46e2ba","resolution":{"observed_at":"2026-08-10T22:30:41.726885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.711295Z","title":"Seeing through noise: Visually driven speaker separa- tion and enhancement","venue":null,"work_id":"14f2b857-e53f-4280-b015-e0704141b7b6","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.965596Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:32dfffa3e715c2082fcd5fbe6c61e125939f9f30d9b042043c1ad319a090c590","observation_id":"9a87c14a-fab0-42d1-b323-d0f98a8f47da","resolution":{"observed_at":"2026-08-10T22:30:41.715075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.08789","last_updated":"2018-06-13T07:25:47Z","snapshot_observed_at":"2026-07-06T06:10:56.764294Z","submitted_at":"2017-11-23T17:51:46Z","title":"Visual Speech Enhancement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.08789","snapshot_observed_at":"2026-08-10T22:30:40.969620Z","title":"Visual Speech Enhancement using Noise-Invariant Training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.969620Z"},"links":{"cited_paper":"/paper/1711.08789","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ef1755297db14fdbcddedb919d83c2c1d92e862fae65b5a853775ec40ae173ee","observation_id":"14e843c0-fdcf-4304-bb15-488a77c03f41","resolution":{"observed_at":"2026-08-10T22:30:40.969620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.699513Z","title":"Tenen- baum, and Antonio Torralba","venue":null,"work_id":"8d73f8fc-526f-4e97-b095-941f37ee408c","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.973935Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:861e04c2daa0f79f3d623b32b0c3a532b8ac0243a1b17a3a94245fe568ff3d2e","observation_id":"47642839-a43a-4d17-b1c7-4f6bd9bfce5d","resolution":{"observed_at":"2026-08-10T22:30:41.703401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.01665","last_updated":"2018-07-26T04:46:24Z","snapshot_observed_at":"2026-08-12T07:45:54.776330Z","submitted_at":"2018-04-05T04:06:46Z","title":"Learning to Separate Object Sounds by Watching Unlabeled Video","version":2},"cited_work":{"arxiv_id":"1804.01665","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.01665","snapshot_observed_at":"2026-08-10T22:30:41.239362Z","title":"Learning to Separate Object Sounds by Watching Unlabeled Video","venue":"cs.CV","work_id":"93ebad63-e93c-43d4-96f1-e232dc0a878b","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.977615Z"},"links":{"cited_paper":"/paper/1804.01665","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:24f54a7f6ea16ebc84f981230036edb76d8d210a7965648b0cccc7b6dd3798da","observation_id":"af3765e5-7ee4-4e70-be0b-70631630a711","resolution":{"observed_at":"2026-08-10T22:30:41.243456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.07750","last_updated":"2019-08-20T21:18:03Z","snapshot_observed_at":"2026-07-06T07:46:29.188511Z","submitted_at":"2019-04-16T15:07:50Z","title":"Co-Separating Sounds of Visual Objects","version":2},"cited_work":{"arxiv_id":"1904.07750","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.07750","snapshot_observed_at":"2026-08-10T22:30:41.223554Z","title":"Co-Separating Sounds of Visual Objects","venue":"cs.CV","work_id":"8cba3349-1526-4e6a-b0a1-bca46339fb98","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.981589Z"},"links":{"cited_paper":"/paper/1904.07750","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:f514034392d5e98b75f65ba568e45a1841c145b10b1e8d198411d61332e0560a","observation_id":"043b39e3-2d44-46ed-aec7-e68bb17ab545","resolution":{"observed_at":"2026-08-10T22:30:41.228155Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.688206Z","title":"VisualV oice: Audio- Visual Speech Separation with Cross-Modal Consistency","venue":null,"work_id":"f4599980-7ba5-416e-8f9c-22659b6b2a65","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.985549Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:852e92faf873d7c1b3fa706ef7ec3d0382437d4bfb4b97fa72ec0b14b7926819","observation_id":"ea8cc40b-b7da-4e9e-a01d-f9f7e666a425","resolution":{"observed_at":"2026-08-10T22:30:41.692101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.678053Z","title":"Multi-modal multi-channel tar- get speech separation","venue":null,"work_id":"31b784b4-2423-4e16-9daa-30b0827d7e15","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.989309Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:2461bb6d156a3eeaa067d8022cb61f5d78b3732257a07b0d390714fb673f1808","observation_id":"95c0dff2-817e-4b81-a01c-9447e9188322","resolution":{"observed_at":"2026-08-10T22:30:41.681770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.666744Z","title":"Hershey, Zhuo Chen, Jonathan Le Roux, and Shinji Watanabe","venue":null,"work_id":"556b6dcf-20f6-4302-a2aa-06cd478fecdb","year":2016},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.993004Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:8ffef1fe015e844e67a7d32d1c2285b3955342afe1b5a8b76f3061169ff23f78","observation_id":"895d562e-4cf0-488d-ac62-931e5016a1db","resolution":{"observed_at":"2026-08-10T22:30:41.670976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03206","last_updated":"2021-06-23T00:25:31Z","snapshot_observed_at":"2026-08-10T00:41:01.806631Z","submitted_at":"2021-03-04T18:20:50Z","title":"Perceiver: General Perception with Iterative Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03206","snapshot_observed_at":"2026-08-10T22:30:40.996705Z","title":"Perceiver: Gen- eral perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:40.996705Z"},"links":{"cited_paper":"/paper/2103.03206","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:8587ca30e82942b36bb4032d67ff25ecf88381d2ae896e8f60235ed77126842a","observation_id":"a6536841-966a-446e-9df7-b7a1a40b160d","resolution":{"observed_at":"2026-08-10T22:30:40.996705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.656200Z","title":"Looking into your speech: Learning cross-modal affinity for audio-visual speech sepa- ration","venue":null,"work_id":"c26f9669-4738-4b49-9f44-e3d7bf535bbf","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.000900Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:47ea47cda119c9febacc491813b26e9618e43e05fa7ae5f1e842fa6683f3a97c","observation_id":"29573d01-f545-40e5-97fa-0338a57339cb","resolution":{"observed_at":"2026-08-10T22:30:41.659982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.646060Z","title":"Parameter efficient multimodal trans- formers for video representation learning","venue":null,"work_id":"7a13cd64-7194-4fd6-9495-8a80a3ab826b","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.005406Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:3c8daa841bb8919857c25f06cd47ccb741b2f4d89d96a5c2f740ba91638cc6e0","observation_id":"b5081915-2b49-492b-be21-8e7cefaff36f","resolution":{"observed_at":"2026-08-10T22:30:41.650080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.634821Z","title":"Audiovisual trans- former with instance attention for audio-visual event local- ization","venue":null,"work_id":"540cae01-b8ef-4156-8593-b524b330a1e8","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.009871Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:5dafa7103b1ce15594b22226ba6d0d59c2c929306e1a8733a8b0f825a4931615","observation_id":"16cd0da0-dcf0-4149-be3f-f141833517bd","resolution":{"observed_at":"2026-08-10T22:30:41.638710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.623569Z","title":"Speaker- independent speech separation with deep attractor network","venue":null,"work_id":"1aa38c80-6912-43b0-b3e9-420246bb4bda","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.013675Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:de2bb06a8db182fc01ad225ccd02d78268beeaa2fe6e5e70a562fd260d33db9c","observation_id":"daeb5589-62dd-47b6-97e2-52ef461facb0","resolution":{"observed_at":"2026-08-10T22:30:41.627331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.609980Z","title":"Attention in dichotic listening: Affective cues and the influence of instructions","venue":null,"work_id":"582dd57a-dc9d-4ec5-889e-2a2f61e4cf84","year":1959},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.017791Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:ae2a50cad573e887116392821c270745a52b0d9c3b34aad0743a0949aca78b46","observation_id":"fa8a0789-3ef8-4ad0-b9fa-870f2b0d0139","resolution":{"observed_at":"2026-08-10T22:30:41.614029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.598703Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"c2b19c69-66cb-4d8e-8518-947973140b68","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.021525Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:84674e309348321b298f7b5a4a583ca13ae3a130471ea1bae747a4c3ad1b7aa7","observation_id":"0027f422-4a53-40ae-83c9-28e7c7e097e5","resolution":{"observed_at":"2026-08-10T22:30:41.602676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.587937Z","title":null,"venue":null,"work_id":"f4ccfee0-b511-4201-bd98-24656249b592","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.026076Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6ad845d63ab1382372347e3a8b65480db02aec6a11ed4ecda81a8a117785f61a","observation_id":"96797977-ada7-4f82-9afd-12465ab51e46","resolution":{"observed_at":"2026-08-10T22:30:41.591631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.576993Z","title":null,"venue":null,"work_id":"47ad7a54-6e0f-4f33-beeb-87038dd98f68","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.031979Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:911333fcd26872bddc0252643a16ce6db73a9a7fe1cc9c3b36746a4c02b34a23","observation_id":"5dbec9bf-5987-4585-93b1-1f46c80d6a0b","resolution":{"observed_at":"2026-08-10T22:30:41.580932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.565657Z","title":"Audio-visual object localization and separation using low- rank and sparsity","venue":null,"work_id":"84f8955a-5304-4f5d-bf60-6e51cde8a756","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.035764Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:efa008b79c2a03cc7414e92a6e732352b9ac3400b11cefc79d5ca192bd8b5247","observation_id":"1b99f204-5e96-45ae-be0d-f747a5de7cff","resolution":{"observed_at":"2026-08-10T22:30:41.569605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.554802Z","title":"mir eval: A transparent implementation of common mir metrics","venue":null,"work_id":"1596a027-d3d2-4d9c-90ea-870b3e45fe22","year":2014},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.039549Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:e989f8e7ced2248de281341eec8a2f8e2bc4a4376e097724ca74f73bf3f26055","observation_id":"2ab1403e-7f12-4380-87af-c1df667eb2ee","resolution":{"observed_at":"2026-08-10T22:30:41.558567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.543523Z","title":"Interspeech 2021 deep noise suppression challenge","venue":null,"work_id":"fd140a98-fdd8-4407-9e5b-9fe0da299941","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.043823Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:dfaa0c5070f2713078c4185f2236b6957568a7a327e26f17d9b7be884ba8a7f9","observation_id":"f89505bb-77e7-4f4f-913d-95f3628267a9","resolution":{"observed_at":"2026-08-10T22:30:41.547587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.530911Z","title":"Visual keyword spotting with attention","venue":null,"work_id":"1d37b850-1e48-47a1-bee7-e59827d9f4ee","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.048654Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:4a08b8233992ca13ac2221ac9fb611b84aa19b847539ced0149f86b28de5b95e","observation_id":"1605df20-c4fb-4ef3-9265-94cc66d4dc32","resolution":{"observed_at":"2026-08-10T22:30:41.535480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.518605Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of tele- phone networks and codecs","venue":null,"work_id":"181cc200-ecf1-4aaa-82fc-40f536ae44f1","year":2001},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.052999Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:e44dfac1d81dbf7e9f9caa63825d91f2c2c3219df3b64b81ea9ddc595632a324","observation_id":"98ba1576-386b-4233-8484-dee668835509","resolution":{"observed_at":"2026-08-10T22:30:41.523260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.056750Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.056750Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:26f395dfa773b6e5baba7f73621c720ba8deaff4b9fd5494681945f9c06f04b1","observation_id":"7bf38965-c9ea-4739-9ec7-3dfa4869b105","resolution":{"observed_at":"2026-08-10T22:30:41.056750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.500674Z","title":"Self-supervised audio-visual co-segmentation","venue":null,"work_id":"eae2d165-e7c4-458a-a973-96fc032dd076","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.060530Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:56cfac294f1cfae0f5d562aa47bc59a41a4bbddf30ae90d94ce7801ee4abd3e3","observation_id":"b46a5225-02d9-431c-8c60-1da3672a0ab8","resolution":{"observed_at":"2026-08-10T22:30:41.504725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.489719Z","title":"Audio-visual speech enhancement using conditional variational auto-encoders","venue":null,"work_id":"dfae8b30-cebc-4888-9c57-0f470b6ecc4a","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.064735Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:da9959cd808aff8093fd29eab42d3a95e5e382c29d8e2b52ed393783ee5e0e62","observation_id":"8439aeb5-1892-4af5-93e5-8858be541a88","resolution":{"observed_at":"2026-08-10T22:30:41.493571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.478850Z","title":"Seeing to hear better: evidence for early audio- visual interactions in speech identification","venue":null,"work_id":"8e0adafe-f492-46fd-8e23-b7547862d48c","year":2004},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.068465Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9de669bd9f395032ec87ba088c3990c85f4a613370f641a9496461ce4a032f0f","observation_id":"8958c87f-7317-48ca-8abc-2a206c2c2e68","resolution":{"observed_at":"2026-08-10T22:30:41.482804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.467318Z","title":"Combining residual networks with lstms for lipreading","venue":null,"work_id":"c61a1b07-b2c9-4619-9e4c-d9ecb70033b7","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.072889Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:dcf62ad41d1979a2e745b585c39d0fd5789aca5c9bf7cc6e69e143bcf82b7a01","observation_id":"925342c2-ae96-4f7e-b01b-7464fd4eef87","resolution":{"observed_at":"2026-08-10T22:30:41.471859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.455437Z","title":"An algorithm for intelligibility prediction of time- frequency weighted noisy speech","venue":null,"work_id":"08bddd27-1509-4f47-88ab-8577b891e1a5","year":2011},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.076646Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:64ea2ae9ae559267d164786120e55762dee4781d8c5107ffc3b3520ad40688de","observation_id":"f5d63be5-f809-4ebc-8f76-4623a4669aa5","resolution":{"observed_at":"2026-08-10T22:30:41.459504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.444527Z","title":"Unified mul- tisensory perception: Weakly-supervised audio-visual video parsing","venue":null,"work_id":"4ce16529-eeec-4bdb-b9d4-7b2fc36eb2b4","year":2020},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.080374Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:f32eaf762b76614da6833761ca8231f71d2ce286fe27df3278085c624c83766f","observation_id":"bf6c4257-0306-4ed4-b4a4-53236c4e19cb","resolution":{"observed_at":"2026-08-10T22:30:41.448453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01143","last_updated":"2021-05-30T03:47:08Z","snapshot_observed_at":"2026-08-04T08:34:08.992124Z","submitted_at":"2020-11-02T17:36:13Z","title":"Into the Wild with AudioScope: Unsupervised Audio-Visual Separation of On-Screen Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01143","snapshot_observed_at":"2026-08-10T22:30:41.084566Z","title":"Into the wild with audioscope: Unsupervised audio-visual separa- tion of on-screen sounds","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.084566Z"},"links":{"cited_paper":"/paper/2011.01143","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:295da4fca92405223b3c3459ebaa9d054e041a3bdd67e973dae54612fd256330","observation_id":"01094ad2-422e-4d84-b36a-b305d6649124","resolution":{"observed_at":"2026-08-10T22:30:41.084566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09669","last_updated":"2021-10-14T04:05:54Z","snapshot_observed_at":"2026-08-13T09:44:26.907441Z","submitted_at":"2021-06-17T17:23:44Z","title":"Improving On-Screen Sound Separation for Open-Domain Videos with Audio-Visual Self-Attention","version":2},"cited_work":{"arxiv_id":"2106.09669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.09669","snapshot_observed_at":"2026-08-10T22:30:41.182394Z","title":"Improving On-Screen Sound Separation for Open-Domain Videos with Audio-Visual Self-Attention","venue":"cs.SD","work_id":"4d7db375-5cd6-4692-9031-1c04275b34b7","year":2021},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.088534Z"},"links":{"cited_paper":"/paper/2106.09669","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:75f307265f6b507c11a815df4c7ff062858bea9da99249eb813235fbed050f61","observation_id":"70ce8276-f361-4f3d-a88e-9a3837b1bd3c","resolution":{"observed_at":"2026-08-10T22:30:41.188958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.433058Z","title":"BSS EV AL toolbox user guide","venue":null,"work_id":"90c59bc2-8ba9-47b2-913c-c5aca2c58b21","year":null},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.092693Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:2df205952e2bd77539e22a0edb20a72a476c74007eb38e70ed4cd164cf9129c4","observation_id":"6c9a8694-407f-4356-aad8-6d1fba8e3278","resolution":{"observed_at":"2026-08-10T22:30:41.437238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.409213Z","title":"Supervised speech sep- aration based on deep learning: An overview","venue":null,"work_id":"9a97be13-9498-4eea-8548-5b5ee9bfd869","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.100737Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:1015d6ffab9381b1b5e0fc1a2fa7f8d370cdf95175df804f3e5cc9d6f302611b","observation_id":"c4a5be8b-1a04-4b42-8acf-601a24046850","resolution":{"observed_at":"2026-08-10T22:30:41.413067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.397200Z","title":"V oicefilter: Tar- geted voice separation by speaker-conditioned spectrogram masking","venue":null,"work_id":"a6d2f450-e994-4152-ab89-6165c2b282e4","year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.104155Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:84e97c545ffc8b7f20e246e424d2cf88d74ace6a5f43baa760275c75f0cd8979","observation_id":"b40b4959-5bfd-4f45-bca7-24f196a58ba5","resolution":{"observed_at":"2026-08-10T22:30:41.401200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.385561Z","title":"Combining spectral and spatial features for deep learning based blind speaker separation","venue":null,"work_id":"c89ba66a-d6f2-4807-8143-1d75e071c364","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.108114Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:3b128dcdebbd7f3999d3453110edcf9be2c301678f1861bcacd91a74a1c94ad6","observation_id":"48bcb8d7-55c5-4300-a1c9-f683f67eb681","resolution":{"observed_at":"2026-08-10T22:30:41.389835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.373340Z","title":"Time domain audio visual speech separation","venue":null,"work_id":"fb6dc912-ab52-4390-9f2f-dc1fccf05bf6","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.111482Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:8761e73e3d01e2ab7cebee2a2864229af29f5c742428d9f3e0406a8ae3dac0e7","observation_id":"aec89adc-0dbb-4aa4-80d4-390ae8562903","resolution":{"observed_at":"2026-08-10T22:30:41.377627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.361684Z","title":"Multilevel language and vision integration for text-to-clip retrieval","venue":null,"work_id":"fe92ecbb-0aa7-4f96-9401-0b200622dd51","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.115377Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:6b927dcdc35757a0e90f5eb6543a3877201ed12e39e5f0f662b695bf061adef9","observation_id":"46297670-87a4-4164-844e-89649023ac2c","resolution":{"observed_at":"2026-08-10T22:30:41.365307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.351545Z","title":"Recursive visual sound separation using minus-plus net","venue":null,"work_id":"0407f14c-9a17-403b-a958-e7b0f204007e","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.118996Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:fa879534c0c662601c8adf438c10da1742acfc3a0e7a843e3a42f724fe11ef3c","observation_id":"7c021b59-cba2-4afd-b9c2-b8154d58eb59","resolution":{"observed_at":"2026-08-10T22:30:41.354847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.340326Z","title":"Permutation invariant training of deep models for speaker-independent multi-talker speech separation","venue":null,"work_id":"a82ea4db-06b1-4c62-98f2-dfe56aae9eed","year":2017},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.123101Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:bce74079302ec86f4b5c1d29e9a0d4c079a16d6c89b84127f3743e2fd16f8e0e","observation_id":"bd574924-a41b-45cd-87e1-d1041bfb2cfe","resolution":{"observed_at":"2026-08-10T22:30:41.344301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.329141Z","title":"To find where you talk: Temporal sentence localization in video with attention based location regression","venue":null,"work_id":"a1e6f6f1-27f4-4dcb-b2be-dd406f4c3b32","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.127305Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:9af521a2dd726c1e0a1956c1be3554d8a42a814c4fb168106aa732bb8f878e9c","observation_id":"3a19ff94-23a7-4a91-b9ef-9504a7120d69","resolution":{"observed_at":"2026-08-10T22:30:41.332912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.317612Z","title":"The sound of motions","venue":null,"work_id":"0ebc98e8-1854-4a5f-923f-a6d9024d672c","year":2019},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.131259Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:859d24e5ab71695201840b61670d9bc9abaf1d867541400ba428808c1bf58781","observation_id":"874a4fa0-1153-49f4-9d49-67239dd48ae4","resolution":{"observed_at":"2026-08-10T22:30:41.321307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03160","last_updated":"2018-10-14T01:09:15Z","snapshot_observed_at":"2026-08-13T00:19:11.912056Z","submitted_at":"2018-04-09T18:00:36Z","title":"The Sound of Pixels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03160","snapshot_observed_at":"2026-08-10T22:30:41.135038Z","title":"The sound of pixels","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.135038Z"},"links":{"cited_paper":"/paper/1804.03160","citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:0c42cbb72494a4adac9f481116ddaefc613d7d391d787b4634d7837c9ccc7141","observation_id":"de3c0aa3-f74f-45a9-9044-40555c7f02a1","resolution":{"observed_at":"2026-08-10T22:30:41.135038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:30:41.421110Z","title":null,"venue":null,"work_id":"10d12814-48f3-4452-8f21-517b91d89007","year":2005},"citing_paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation","version":1},"reference_index":1706,"source":"pdf_text","source_observed_at":"2026-08-10T22:30:41.097036Z"},"links":{"citing_paper":"/paper/2501.01518"},"observation_digest":"sha256:85420c85fbe81188002a631cea540057bff707aaf070bef62df71c885dd97bc1","observation_id":"6aec83be-3d62-49aa-9182-461b5a26161e","resolution":{"observed_at":"2026-08-10T22:30:41.425188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.01518","last_updated":"2025-01-02T19:53:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T09:32:22.319480Z","submitted_at":"2025-01-02T19:53:25Z","title":"Reading to Listen at the Cocktail Party: Multi-Modal Speech Separation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":3,"verified_fuzzy":42},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2501.01518."}