{"as_of":"2026-08-21T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d31ec909fbfb5b4aaa5469d967cc27b5f98753c504fca2a5eb5d2bc3bb85a05","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:50:49.884180Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:50:45.946937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T11:50:50.003069Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2506.01270","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01270","snapshot_observed_at":"2026-08-07T11:50:50.003069Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","venue":"eess.AS","work_id":"ddd4dccc-8881-4beb-a522-6c3a9b2ea312","year":2025},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:45.946937Z"},"links":{"cited_paper":"/paper/2506.01270","citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:ece3fbd62c98dc34c6f45ccb9656a73a3e2d55d3d954d6feee979e272eeafdf3","observation_id":"c0bb2916-2367-4544-8184-3e624188d338","resolution":{"observed_at":"2026-08-07T11:50:50.031211Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01270/citation-record","integrity":"/paper/2506.01270/integrity","json":"/paper/2506.01270/citation-record.json","paper":"/paper/2506.01270"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"cited_work":{"arxiv_id":"2506.01270","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.01270","snapshot_observed_at":"2026-08-07T11:50:50.003069Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","venue":"eess.AS","work_id":"ddd4dccc-8881-4beb-a522-6c3a9b2ea312","year":2025},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:45.946937Z"},"links":{"cited_paper":"/paper/2506.01270","citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:ece3fbd62c98dc34c6f45ccb9656a73a3e2d55d3d954d6feee979e272eeafdf3","observation_id":"c0bb2916-2367-4544-8184-3e624188d338","resolution":{"observed_at":"2026-08-07T11:50:50.031211Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.581475Z","title":"pseudo past extracted speech","venue":null,"work_id":"bc3399ea-2250-42df-a526-ee1d77af8520","year":null},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.061921Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:99637538b75929cb84b5c59ce8c25ed1a5a13b2afb85b69c07494eb3904a05cd","observation_id":"ce03a151-9cda-4578-93e7-be345624fcf8","resolution":{"observed_at":"2026-08-07T11:50:54.601221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.524600Z","title":"Dataset We mainly use the Lip Reading Sentences 3 (LRS3) dataset to validate our proposed method in this work [29], which is widely used in many A VSE studies [34–36]","venue":null,"work_id":"11ac9b42-c3ca-4486-a185-212f372c12c0","year":null},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.143478Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:df08b36e359cca05acc63f263e2bdb72dcc159bb40895ce99221a7058b707ee7","observation_id":"ec701100-3023-4995-92f5-82ac578580bf","resolution":{"observed_at":"2026-08-07T11:50:54.548076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.478814Z","title":"All improve- ments are calculated relative to the unprocessed multi-talker speech signals","venue":null,"work_id":"7d1a9d1f-7fbb-4d5c-831f-6b1675e81568","year":null},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.230175Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:d052d35b3bbba71d6e13356c736faabb70f300a2a2b88a4875201d1441545a95","observation_id":"c4fd1eef-0518-4b67-bae9-21b283447642","resolution":{"observed_at":"2026-08-07T11:50:54.505498Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.410676Z","title":"The proposed visual en- coder, with its lightweight design and efficient processing, pro- vides a competitive alternative to the more complex visual en- coder","venue":null,"work_id":"11a0aff3-5c71-418c-84ae-89369b46f6f5","year":null},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.312156Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:f95d3c4849a7be85892f0cf63b842130a13cadcfc729ea28b4bd42bc11638f67","observation_id":"e69b16ad-948b-4e99-82a6-270fe3813ccc","resolution":{"observed_at":"2026-08-07T11:50:54.444857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.349112Z","title":"Some experiments on the recognition of speech, with one and with two ears,","venue":null,"work_id":"c1a6bd56-57f4-4e64-8e7d-be3fc46c99c7","year":1953},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.447958Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:61dd1ce2bd869bca7cb4137801204a2922f8f032548adb5d4cf41b465cd6e541","observation_id":"4c98a724-67a7-4f3f-bb5c-f388384a8ce9","resolution":{"observed_at":"2026-08-07T11:50:54.370756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.295936Z","title":"Restoring speaking lips from occlusion for audio-visual speech recognition,","venue":null,"work_id":"a7c6df37-f913-497c-9a07-75d94d4a2e4e","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.558333Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:739b494e482c1d3dd2ac086a210e189064359cb1a6b10c408978802a4ec9077c","observation_id":"acacf362-dc1b-416a-8cd0-0c191d56ce1e","resolution":{"observed_at":"2026-08-07T11:50:54.319219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.243069Z","title":"Deep clus- tering: Discriminative embeddings for segmentation and separa- tion,","venue":null,"work_id":"538f8915-eaf9-4e3d-8dcb-fd1b19acda6e","year":2016},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.663185Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:5de9276da7015fdb306c10cd7fdbe26c7f83db339fd1a575a97f81885b312814","observation_id":"8a23a9c5-99ca-4986-88e3-c1be43aaf497","resolution":{"observed_at":"2026-08-07T11:50:54.266693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.158756Z","title":"Conv-TasNet: Surpassing ideal time–frequency magnitude masking for speech separation,","venue":null,"work_id":"6029ca9d-9208-408e-8e95-3c686aa95560","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.762989Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:f70d188bf45f7c24287568eb457795088615af83434920bc7b0ee7899b9a0a29","observation_id":"36529006-3bd3-44f2-8c80-b56bd9a14608","resolution":{"observed_at":"2026-08-07T11:50:54.200466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:54.041889Z","title":"Dual-Path RNN: Efficient long sequence modeling for time-domain single-channel speech sepa- ration,","venue":null,"work_id":"163f15b6-1fcb-4f57-a3a9-a80004afd2ef","year":2020},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:46.873189Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:444a9c548acd5798ec187b5270b961898d1b434bb0b5117c758522a57b318ec3","observation_id":"f9d9b155-52f7-42cc-a7ad-9b5ba50224aa","resolution":{"observed_at":"2026-08-07T11:50:54.095360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.918425Z","title":"TF-GridNet: Making time-frequency domain models great again for monaural speaker separation,","venue":null,"work_id":"6f3c2766-3335-41fa-bb78-6b79a2fa575d","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.025238Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:3ae8164ddb878545b4852580de3ddda47fd132e9831bb72fc2309d6ddd6bc9d6","observation_id":"d5aaa220-4d04-42d1-9e13-1cf09631eb0a","resolution":{"observed_at":"2026-08-07T11:50:53.956566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.834505Z","title":"Mossformer2: Combining transformer and rnn-free recurrent network for enhanced time- domain monaural speech separation,","venue":null,"work_id":"9d013163-14f0-43f5-9915-b807a964b3c6","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.108156Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:4a8cdfcccf0360da4752b32231edb492f510cb09b4c7d512d8a8de461e82d088","observation_id":"da0bb5f4-376a-45d2-ae30-93b40f7e729a","resolution":{"observed_at":"2026-08-07T11:50:53.871922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.727822Z","title":"V oice- Filter: Targeted voice separation by speaker-conditioned spectro- gram masking,","venue":null,"work_id":"5ea3078c-ecb0-4ec6-9379-4e6f879f7677","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.185101Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:d549c4447a4230760ca267b2d1bb2e69ccdc0b0919c56e1544663f8dd52a84ce","observation_id":"06a1a5a5-0872-4348-84f2-cde2b38d109f","resolution":{"observed_at":"2026-08-07T11:50:53.775445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.625294Z","title":"SpeakerBeam: Speaker aware neural network for target speaker extraction in speech mixtures,","venue":null,"work_id":"5c24720a-9261-4f03-9330-a23ca77277ed","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.287943Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:5c80753a6e719d2c13e93f31ce2a2fe1acd435bedf4624eacb5a05c192e09d31","observation_id":"0bcb3c14-7c28-4a3e-8859-7ed55aea51c1","resolution":{"observed_at":"2026-08-07T11:50:53.681268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.517939Z","title":"SpEx: Multi-scale time domain speaker extraction network,","venue":null,"work_id":"dd31d55a-9077-4c0e-a87e-73ca0dad8d7d","year":2020},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.368732Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:174d418b004120b30800f1687a3b7d945a3b44e652c5f3934c9890ec09a07389","observation_id":"d0b41310-99cd-49b6-99a6-1a1969c83399","resolution":{"observed_at":"2026-08-07T11:50:53.573479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.442280Z","title":"Looking to listen at the cock- tail party: a speaker-independent audio-visual model for speech separation,","venue":null,"work_id":"7e5faf79-3ca3-4010-b90c-45e297499c4c","year":2018},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.435865Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:422cc1088f423de72f86a87236427c99d58f41b000cac8d9bfb89892834b0927","observation_id":"862ee3c5-15eb-4d2d-9b62-f452c8757511","resolution":{"observed_at":"2026-08-07T11:50:53.489372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.333546Z","title":"Scenario-aware audio-visual TF- Gridnet for target speech extraction,","venue":null,"work_id":"7f8dd2d4-30dd-4827-a93b-2d419be74feb","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.540980Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:62523ed04cfdec56f4837f3139329b87b7756777ba80485193c305c0dc42f01b","observation_id":"a9e535be-dc5c-4eec-8e24-6bd511b70bc3","resolution":{"observed_at":"2026-08-07T11:50:53.391924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.224043Z","title":"Time domain audio visual speech separation,","venue":null,"work_id":"c6ceb814-26d4-427e-9894-6cf507c89395","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.661462Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:f5006f4d90673d9b7c8c1583e33c510fb0a835f04466e1aa87830c1773b0d404","observation_id":"4e460beb-d76d-48e7-b698-c1f08372a26f","resolution":{"observed_at":"2026-08-07T11:50:53.273195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.131034Z","title":"Selective listening by synchro- nizing speech with lips,","venue":null,"work_id":"e7057979-1454-4bcf-832e-330e9778a079","year":2022},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.774934Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:12e2d63a8af049a81d222d4615b25b2712ff0be6b845b648c1276fbe967486d6","observation_id":"959f2c3a-c0eb-4694-89e5-c85f72243a22","resolution":{"observed_at":"2026-08-07T11:50:53.167144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:53.019763Z","title":"FaceFilter: Audio-visual speech separation using still images,","venue":null,"work_id":"02b1a842-4743-459b-abc8-be12e73c43af","year":2020},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:47.896449Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:f3332bda89afe2a3defcaed8da25fe8b616e54807a39c065709a4ced60d7b6c7","observation_id":"9f38ef15-19ca-418a-8d91-2e61a275589f","resolution":{"observed_at":"2026-08-07T11:50:53.071792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.939087Z","title":"Brain- informed speech separation (BISS) for enhancement of target speaker in multitalker speech perception,","venue":null,"work_id":"7c4b4ce9-ab34-40bc-9415-091cb928ad45","year":2020},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.010934Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:4e18fe705bfc4ab24311d3bbdd1d1d0110a79b87c725eaa0b06f2db442388375","observation_id":"3c11cfa0-3fa1-482c-ae8a-a436d0d73c27","resolution":{"observed_at":"2026-08-07T11:50:52.968873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14303","last_updated":"2023-07-26T17:07:27Z","snapshot_observed_at":"2026-08-16T15:13:04.045266Z","submitted_at":"2023-07-26T17:07:27Z","title":"NeuroHeed: Neuro-Steered Speaker Extraction using EEG Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14303","snapshot_observed_at":"2026-08-07T11:50:48.079784Z","title":"Neu- roHeed: Neuro-steered speaker extraction using EEG signals,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.079784Z"},"links":{"cited_paper":"/paper/2307.14303","citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:adc529ab32ff3dc0d97c1b5b4d268aaa00fb98e7e7d7d67fb90f9a1d3af2cda9","observation_id":"5f239228-c3cf-4fd8-a929-251aae6a68f3","resolution":{"observed_at":"2026-08-07T11:50:48.079784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.851838Z","title":"NeuroHeed+: Improving neuro-steered speaker extraction with joint auditory attention detection,","venue":null,"work_id":"c0a88009-43ef-4b6b-8891-3f820f402a72","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.181836Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:abff7c50e0be4632b5fdfde9220a6e3f9cd856ca684a0afa63cdad38bed5d0b0","observation_id":"8e02594b-dcc2-4169-b27a-699abd8ab9cb","resolution":{"observed_at":"2026-08-07T11:50:52.892960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.794280Z","title":"V oiceFilter-Lite: Streaming targeted voice separation for on-device speech recog- nition,","venue":null,"work_id":"c7573a5b-a1e8-44d7-acb1-fa11f79a4d99","year":2020},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.300416Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:6ca7e7f703b447b0a9f0fd5e87e2a0a45e6780fa843e3e97c2c7c95dc7a8f0ca","observation_id":"b1beb070-f189-46f9-b306-c2d40b487bb3","resolution":{"observed_at":"2026-08-07T11:50:52.825277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.686018Z","title":"Papez: Resource-efficient speech sepa- ration with auditory working memory,","venue":null,"work_id":"dc7f2489-e07e-4d76-90d5-f032d4c757b8","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.411506Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:9f35e3b88abc1707a04581b1089b104915b207d3ecc950c5f8e65df8cf06c345","observation_id":"866ccd12-e1fe-49ff-b9cc-47965431eab0","resolution":{"observed_at":"2026-08-07T11:50:52.737790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.575828Z","title":"SkiM: Skipping memory LSTM for low-latency real-time continuous speech separation,","venue":null,"work_id":"1846329f-7e51-4888-9124-c073d925a4ff","year":2022},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.553960Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:094799e053358016306466003ae2a363b5eed9526b811a4dc37feb2e3d24db81","observation_id":"1fa3fe15-e872-41fb-9b66-c67efa9a29b5","resolution":{"observed_at":"2026-08-07T11:50:52.619213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.466760Z","title":"Resource-efficient separation transformer,","venue":null,"work_id":"54c2e2b3-3beb-4637-88ba-72ce863d8cd4","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.687287Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:6589a740a41e219cf5f8abdf65488c530d92d5a29fb7284b81683be118709f32","observation_id":"afbcb701-099d-4d62-b252-086dbd33e94a","resolution":{"observed_at":"2026-08-07T11:50:52.513483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.358734Z","title":"RT-LA-V ocE: Real- time low-SNR audio-visual speech enhancement,","venue":null,"work_id":"1cdf6111-c4dd-4623-b125-dc332fb85c65","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.768089Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:f6bda69d1ff43965dcb8e3cd1da01efca69d0c7d2138b2efe02825adc0a3477f","observation_id":"a2d34585-d1dd-4d1f-ace2-1381f1283e16","resolution":{"observed_at":"2026-08-07T11:50:52.414327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.261134Z","title":"USEV: Universal speaker extraction with visual cue,","venue":null,"work_id":"852760e5-a4d3-4e0c-bbf3-f08bccc4e7f2","year":2022},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.873704Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:c97869664d08f9e2b812228b1d9bb5183cab786d95146aae936a9c962e9175bc","observation_id":"2fc7b33a-982c-4b07-871f-386bbaf5cf5e","resolution":{"observed_at":"2026-08-07T11:50:52.298472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:52.160556Z","title":"Real-time audio-visual end-to-end speech enhance- ment,","venue":null,"work_id":"3187ebf3-d1dc-4016-8f32-0161759f643d","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:48.969007Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:c2ef915ed4b1edbf16fe3bcee1d15d2a55e8a11ac0507f66eaa3fc570cb07048","observation_id":"0fe65e12-aa9c-416e-a257-3586680a3dcf","resolution":{"observed_at":"2026-08-07T11:50:52.205859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.967191Z","title":"BlazeFace: Sub-millisecond neural face detec- tion on mobile GPUs,","venue":null,"work_id":"dc14705d-5e34-4e37-947d-5855d9112e7f","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.032778Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:9edc694ec6099311f2954c53ab0eb5ff1b31321689fb1abf39aa34aa2f7d6334","observation_id":"8db1e0e9-c7b2-4c06-9935-569a61406b40","resolution":{"observed_at":"2026-08-07T11:50:52.058424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.850055Z","title":"Xception: Deep learning with depthwise separable convolutions,","venue":null,"work_id":"346a8713-fcf4-4ba0-96f5-16e750de7407","year":2017},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.078134Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:ac49100e00f393c376b9824593eefd079f6819585fc3c59e3bccb15b9cc92bcf","observation_id":"1a6f1f38-727e-4965-9ebd-232eee34fb2c","resolution":{"observed_at":"2026-08-07T11:50:51.893803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.752792Z","title":"PARIS: Pseudo-autoregressive siamese training for online speech separation,","venue":null,"work_id":"b6fa2a3b-cd73-4b99-95a1-fab2233abc46","year":2024},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.123881Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:e5584ccba34e0b79e37d89f39caed6db189f09da2d644453b01f9fde24a9c80d","observation_id":"8da9928e-d137-4ee7-9786-714afc877e7f","resolution":{"observed_at":"2026-08-07T11:50:51.789307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-08-16T06:08:36.265981Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-07T11:50:49.167617Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.167617Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:4c3751b0ad296bcdddd0ff9c76bcc2cb6cb671c86805a13ee0dbc52a0dda8d81","observation_id":"e3be1cbd-ca63-4c40-8f67-cf50e492bb74","resolution":{"observed_at":"2026-08-07T11:50:49.167617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.611427Z","title":"Deep lip reading: A comparison of models and an online application,","venue":null,"work_id":"e3605163-ef52-46d3-abcb-7c6e62828157","year":2018},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.212256Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:9ec7e5cedd2f04e90fa988a682dc58b7b8227b055abec3a22327fd0f2dd2f579","observation_id":"57341b6c-1d97-4a12-9078-2ee72405c140","resolution":{"observed_at":"2026-08-07T11:50:51.705874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.429768Z","title":"MuSE: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"9341c8a5-50d5-4137-89dd-5908cf5b0ffb","year":2021},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.264090Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:b1c58e1051dde2241b4ca91485a14f10e54e6fcb54f9cab9a49a6c4f7e50e0d6","observation_id":"ded28af7-8f67-41cd-adad-d2195784ee71","resolution":{"observed_at":"2026-08-07T11:50:51.504364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.242110Z","title":"SDR– half-baked or well done?","venue":null,"work_id":"641cac97-a76a-429c-a207-cfbdf86733a3","year":2019},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.313436Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:bc5963beec02e12fcabc97f9da3fe266ec0035bb3eeadf51f1aa433c3fc0f5ca","observation_id":"993a4242-7a2b-4b70-8726-b71ff01b3839","resolution":{"observed_at":"2026-08-07T11:50:51.325118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:51.103573Z","title":"A hybrid continuity loss to reduce over-suppression for time-domain target speaker extraction,","venue":null,"work_id":"0afe2184-e249-45d3-b6a5-51ed19efedd5","year":2022},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.370327Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:29bad73929d384fc450b9eef4001c7e59e4cfcff81d0b37d0491c0bf46621902","observation_id":"000c2997-b4e3-464e-95b6-6ce93a75e03c","resolution":{"observed_at":"2026-08-07T11:50:51.141121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.950760Z","title":"ReVISE: Self-supervised speech resynthesis with visual input for universal and generalized speech regeneration,","venue":null,"work_id":"8e725428-452d-482d-ba5e-8aebd2fa812a","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.407524Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:dd2882e27bd67f1b2f1d419b54f9061c1286fc3d39ec5c1434f8a73c9006156d","observation_id":"506f3ef7-487d-4a88-9952-9d0921026f86","resolution":{"observed_at":"2026-08-07T11:50:51.007488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.818560Z","title":"PIA VE: A pose-invariant audio- visual speaker extraction network,","venue":null,"work_id":"bd8907ef-5782-4500-afa5-1eb80782b46c","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.451366Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:876cea4654070d76ca679c9965e9921558d33cce0eb7f1ff90ff0f6db4866d90","observation_id":"bfb8f8cd-2e02-4c74-ac72-95ab2da7280b","resolution":{"observed_at":"2026-08-07T11:50:50.883044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.663580Z","title":"Audio- visual speech separation in noisy environments with a lightweight iterative model,","venue":null,"work_id":"b061300b-da7f-41aa-a6e0-2aa24d950ecb","year":2023},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.498451Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:789520a1a85c586fd4f725bfc09cf36301fde45614853d4f9f42a725297d63ec","observation_id":"6722909d-3a70-46f3-9a83-0ef8ada3c5d3","resolution":{"observed_at":"2026-08-07T11:50:50.756506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.574403Z","title":"Adam, a method for stochastic optimiza- tion,","venue":null,"work_id":"a6d39a32-b1a5-452a-8e5c-faaf322b20d6","year":2015},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.600183Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:8b4bca38278122c7d8b4c093b864bc69db3908ee9fb69b9785e5764a37ecd63a","observation_id":"9f4a7fef-d652-4b69-9a11-f4f5e11d8f50","resolution":{"observed_at":"2026-08-07T11:50:50.626463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:49.679700Z","title":"Performance mea- surement in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.679700Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:425ca72d21021c7f1fb48d04b22468641483237d2db05e76bc3992c416bc028f","observation_id":"ef72e77f-0bb0-4e40-8879-c998dffb32e6","resolution":{"observed_at":"2026-08-07T11:50:49.679700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.439723Z","title":"Per- ceptual evaluation of speech quality (PESQ)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"6fa9689a-b980-455a-a56f-27143fe670f1","year":2001},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.721577Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:5d69dc0586c88713c9c8d72017fa7d3fb3a56ccb20cb01198a4525fae55e86ca","observation_id":"9370e7b9-421e-42cd-9b3a-03339db643a6","resolution":{"observed_at":"2026-08-07T11:50:50.505960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:49.782532Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.782532Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:7ce7ce6033137dab45316844017e335371d5ae0282dcfc480ac2bace741464fc","observation_id":"eed5317f-9f84-4542-be5a-f322163b464a","resolution":{"observed_at":"2026-08-07T11:50:49.782532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.250041Z","title":"V oxCeleb2: Deep speaker recognition,","venue":null,"work_id":"3f7883fb-bf40-4d02-a0ff-c863c4b0d784","year":2018},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.831817Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:55ec5e9f345c9c3de5c8bbc6f8d1e537207dfc3a42a8bc55700688396b23a781","observation_id":"83bd3914-87fb-43d7-a216-331d466c124d","resolution":{"observed_at":"2026-08-07T11:50:50.342860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:50:50.100133Z","title":"TCD-TIMIT: An audio-visual corpus of continuous speech,","venue":null,"work_id":"fc70b7c0-589a-4916-93cf-66c888130e69","year":2015},"citing_paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:49.884180Z"},"links":{"citing_paper":"/paper/2506.01270"},"observation_digest":"sha256:53a13cfe8b7c61251f44c322cb9d74bb2d0b71ad4f7de2b04a283e46f2fd1117","observation_id":"2d9ecaa1-10c4-408e-ab9c-fa32ea251442","resolution":{"observed_at":"2026-08-07T11:50:50.169266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01270","last_updated":"2025-06-02T02:47:53Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-17T19:48:14.689687Z","submitted_at":"2025-06-02T02:47:53Z","title":"Online Audio-Visual Autoregressive Speaker Extraction"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2506.01270."}