{"as_of":"2026-08-09T22:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5fcfbd991f40a98aa6f96fe31bdc8b2da9cc4a13a8d290ad3d9a47580a1df495","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:04.812385Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:46:04.622698Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T04:46:04.891505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"cited_work":{"arxiv_id":"2506.09792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09792","snapshot_observed_at":"2026-08-07T04:46:04.891505Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","venue":"cs.SD","work_id":"0f1c2347-fdfe-45af-88dc-a0916ccc9339","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.622698Z"},"links":{"cited_paper":"/paper/2506.09792","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:15c7b3898c6788681ee7021a397de37b63012b5317198294995b28e8b3b41d3a","observation_id":"bd51abf4-a74b-46fe-be2e-d77959f7cc4a","resolution":{"observed_at":"2026-08-07T04:46:04.897605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09792/citation-record","integrity":"/paper/2506.09792/integrity","json":"/paper/2506.09792/citation-record.json","paper":"/paper/2506.09792"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.464133Z","title":"Most existing studies focus on improving the audio-visual fusion mechanisms [1, 2, 3, 4, 5] or addressing visual cue-impaired scenarios [6, 7]","venue":null,"work_id":"11f7139e-d64a-4179-aaeb-f825cc9d52e6","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.617264Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:c00ec6a439730c02d4dfc0bb37b73194f6e2bb0a02ea9c8bd96c76d6a01cb466","observation_id":"dc2de33d-730c-49d9-8dc4-cc305f4e20d3","resolution":{"observed_at":"2026-08-07T04:46:05.469713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"cited_work":{"arxiv_id":"2506.09792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.09792","snapshot_observed_at":"2026-08-07T04:46:04.891505Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","venue":"cs.SD","work_id":"0f1c2347-fdfe-45af-88dc-a0916ccc9339","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.622698Z"},"links":{"cited_paper":"/paper/2506.09792","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:15c7b3898c6788681ee7021a397de37b63012b5317198294995b28e8b3b41d3a","observation_id":"bd51abf4-a74b-46fe-be2e-d77959f7cc4a","resolution":{"observed_at":"2026-08-07T04:46:04.897605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.448614Z","title":"Dataset In this study, several experimental settings are considered: •Training Set:A two-speaker mixture training set is simu- lated following previous work [1, 6, 2, 3]","venue":null,"work_id":"286c15cd-442b-482e-9177-767682f41aa6","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.627656Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6a7ab6a05d27534634cc3569dca238a3aef6af280e905bebc52fb51ed8260604","observation_id":"bdec9dcb-8ec5-42ea-9e00-963626b2f9bd","resolution":{"observed_at":"2026-08-07T04:46:05.453563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.433994Z","title":null,"venue":null,"work_id":"0fb66702-6a69-4e02-bd90-6414fe21a44b","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.633169Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:8453ddc30aaf1cf3a8472cd8abf7ab0b7568ca5aed6d4b8397d7a97b0403c95e","observation_id":"6dfff320-741e-4807-8bea-7aaa4718b772","resolution":{"observed_at":"2026-08-07T04:46:05.438722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.419213Z","title":"Full occ","venue":null,"work_id":"99e8b86f-6fe3-4895-a351-3c9ac17a7314","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.638070Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:b523cdbeb3ee9afec15e479a18740d144a1faf8109688f62a543707efe748308","observation_id":"715afddc-d228-491b-bd38-b22495bee4f9","resolution":{"observed_at":"2026-08-07T04:46:05.423908Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.403465Z","title":null,"venue":null,"work_id":"236b7a2f-27f5-4c97-b96a-206d849b4542","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.643723Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:ed0664e2bd1a19d0679cbd424e06fda33507560f11be334f405941b56592e7b1","observation_id":"554b79fa-87ed-4956-9e48-178c2cbd62e7","resolution":{"observed_at":"2026-08-07T04:46:05.408576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.387553Z","title":"62401377, Shenzhen Sci- ence and Technology Program (Shenzhen Key Laboratory, Grant No","venue":null,"work_id":"96679d1a-56a3-40c0-8e69-ccf05fcade9c","year":null},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.648600Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:65fc8212e4f5d9c4721fc7d0a3cda28f2c0b0468188fdb36671090220973087c","observation_id":"f77eb3b3-5e62-42a7-a8a1-15d631fae36a","resolution":{"observed_at":"2026-08-07T04:46:05.393041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.371925Z","title":"Muse: Multi-modal target speaker extraction with visual cues,","venue":null,"work_id":"81b9e0ea-51cc-4951-880c-41cd449a1752","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.653741Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:a9c2dc44bae1485d8322cb5986ab898635786b784ea73b13d3ed2728ccdcbfcf","observation_id":"277ee2e9-90dc-421c-8b38-bbdb74a5141e","resolution":{"observed_at":"2026-08-07T04:46:05.377153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.357115Z","title":"Av-sepformer: Cross-attention sepformer for audio-visual target speaker extraction,","venue":null,"work_id":"1d2fd2b6-9f30-43a4-8b9f-4d212bb293a8","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.658898Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:8567bdac4a6f47e729f01ce894f858dd5e0d7018874e1c0e856931bd5e2a99ba","observation_id":"5ecfee67-d124-4cc9-b4a4-b30340e60df6","resolution":{"observed_at":"2026-08-07T04:46:05.361888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.342016Z","title":"Avhumar: Audio- visual target speech extraction with pre-trained av-hubert and mask-and-recover strategy,","venue":null,"work_id":"18ba1ca4-6159-4991-85d7-f45881b0ba1e","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.663935Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:35b9572f9aab826149a866890eaf22cd0af9952c653a174d7d7d9f8bd078a420","observation_id":"dc1f0523-48b4-4580-b3cb-863bb54eea93","resolution":{"observed_at":"2026-08-07T04:46:05.347080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.326969Z","title":"Target speech extraction with pre-trained av-hubert and mask-and-recover strat- egy,","venue":null,"work_id":"4cab8719-1a0b-4ae6-99a5-d2cfab92c5cf","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.669226Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6426cc94795e5a5dfdd34379d1916520408fefaeac8190eadd677f15b029e342","observation_id":"e9d1b61d-adb8-4864-84af-404c35a7c337","resolution":{"observed_at":"2026-08-07T04:46:05.331829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.313055Z","title":"c 2av-tse: Context and confidence-aware audio visual target speaker extraction,","venue":null,"work_id":"de5ffac7-b736-46a7-b8ed-b87eaf509340","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.674131Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:c9f9dcfc555439623a092c9af5ea7c00c49253f44e92bced2c00ba8053d7b059","observation_id":"9f2fce59-8df6-46fc-a264-defe611a2a0e","resolution":{"observed_at":"2026-08-07T04:46:05.317657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.298422Z","title":"Imaginenet: Target speaker extraction with intermittent visual cue through embedding inpainting,","venue":null,"work_id":"2169cc6e-55ab-4e07-8ed0-b48a7cc475a1","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.679148Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:c759f27a13cc72c1bd4ca9342abb1267a1d224c19e8d51b731d4035cc453105b","observation_id":"fb5b5b21-c426-4760-ba87-16c0ddf158b4","resolution":{"observed_at":"2026-08-07T04:46:05.303072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.282293Z","title":"Restoring speaking lips from occlusion for audio-visual speech recognition,","venue":null,"work_id":"bb0b664f-576a-4281-9149-241ae57e4f4a","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.684022Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:33dac25126973d5f27f1d1e48959ac86af737d133301d55dfe5f719e9ddacbd0","observation_id":"e0ad3710-a4cd-4595-8c2f-a4944678ed28","resolution":{"observed_at":"2026-08-07T04:46:05.287472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.267129Z","title":"Semantic en- coding during language comprehension at single-cell resolution,","venue":null,"work_id":"d29b3535-3e87-4de2-9e5b-ab8178921269","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.689743Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:41a3576dea90dd9580ba027692bafa5f2712c98ebe569b9c7a4a419462dc1673","observation_id":"1d9e7c30-6caf-405d-8f3f-df8ed062ab1f","resolution":{"observed_at":"2026-08-07T04:46:05.271997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.251398Z","title":"Hubert: Self-supervised speech representa- tion learning by masked prediction of hidden units,","venue":null,"work_id":"dcc5362e-8009-4d1d-b6b5-3683e7c83f0a","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.694126Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:12f8745749ed91ebfcbc6a9115de9d9c69b59faa7ac2bc150ab3751ba70987e1","observation_id":"747ba67d-bf1f-43dd-bba5-3db1cc01ab66","resolution":{"observed_at":"2026-08-07T04:46:05.256584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.236148Z","title":"Large language model can transcribe speech in multi-talker scenarios with versatile instructions,","venue":null,"work_id":"3889caee-0377-49f6-9d89-42136f6b0766","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.698793Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:182fc23bae07e6c427c1e263beddbcff0849760b53cd5bbbb8bc5b06d458012f","observation_id":"ce3d5104-6aa5-4de9-8092-a6289ee7cd5f","resolution":{"observed_at":"2026-08-07T04:46:05.240980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.220684Z","title":"Target speech extraction with pre-trained self-supervised learning models,","venue":null,"work_id":"dd4eb670-ef8c-4821-82b6-afb2c940dd00","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.704344Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:d5cad1ae5d2206df84de763affd467a1bcf1497256d10e137ef6e67c97013f58","observation_id":"e133f23a-cfdd-4793-945f-bc8822d23e76","resolution":{"observed_at":"2026-08-07T04:46:05.225837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.205468Z","title":"Probing self-supervised learning models with target speech extraction,","venue":null,"work_id":"591c03a8-4ff9-4b21-939d-ff9035aa6ea8","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.708724Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:b10013143db00a1a06c3b1f38c6276a52908f76675c2328a3c9a501eba5d3fbd","observation_id":"e15dd3bf-0e42-49e5-aeb5-e76d5bcad2a6","resolution":{"observed_at":"2026-08-07T04:46:05.210381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.189833Z","title":"A large-scale evaluation of speech foundation models,","venue":null,"work_id":"5f342881-95cc-453b-93fc-5ab4284cc97f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.713437Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6658e7bc7c8b135a5f42d24aa4b96e68357f4f79dac578554337082e320693f7","observation_id":"78c595a9-fa23-41e9-b7e4-e1ed7ad327c5","resolution":{"observed_at":"2026-08-07T04:46:05.194831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.174301Z","title":"Transferring knowledge from large foundation models to small downstream models,","venue":null,"work_id":"03b5a2e7-d97d-40eb-a8a0-e7e69e2b729a","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.718269Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:2718bc279e6dd94f44777f5b6a8957f4192362db92cb57a165790a774db73b81","observation_id":"a571c4ce-40a4-4f71-b03d-16c5d536b767","resolution":{"observed_at":"2026-08-07T04:46:05.179377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.158263Z","title":"Knowledge transfer from pre-trained language models to cif-based speech recognizers via hierarchical distillation,","venue":null,"work_id":"d33c3d78-5c02-479e-a708-a6bc072c7008","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.723757Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:a2d21517879338e1f130d142af5df773e2789590bd9ae9a38b20dbf21c038e00","observation_id":"62790262-403f-4144-b32a-f3b86abd677e","resolution":{"observed_at":"2026-08-07T04:46:05.163405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.142015Z","title":"Speechtok- enizer: Unified speech tokenizer for speech large language mod- els,","venue":null,"work_id":"a19b8e89-ee28-4171-80db-63e3d9c7aa6f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.728231Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:9b4aff0f1ca159a94f0ac5fdf7e39e6052efaa8331dc431f5152ec44cf295590","observation_id":"b915031b-a18a-458b-90d7-4e2dd441ec03","resolution":{"observed_at":"2026-08-07T04:46:05.146935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15764","last_updated":"2025-05-21T16:46:32Z","snapshot_observed_at":"2026-07-06T19:36:54.626904Z","submitted_at":"2024-10-21T08:23:31Z","title":"LSCodec: Low-Bitrate and Speaker-Decoupled Discrete Speech Codec","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15764","snapshot_observed_at":"2026-08-07T04:46:04.733824Z","title":"LSCodec: Low-bitrate and speaker-decoupled discrete speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.733824Z"},"links":{"cited_paper":"/paper/2410.15764","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6e0ae177347b8cf5a58e8cabd070473def29a1ec6beccb08d0d03b1f01f61076","observation_id":"97115ffb-4df0-4dc0-9975-36526792fae7","resolution":{"observed_at":"2026-08-07T04:46:04.733824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.126655Z","title":"ALMTokenizer: A Low- bitrate and Semantic-rich Audio Codec Tokenizer for Audio Lan- guage Modeling,","venue":null,"work_id":"de5f12b5-45a4-4e0f-b6a8-b75129a54b07","year":2025},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.738953Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:3f27e2e32359877ed07060c68e4ee43166cfccd45d8905e620d7fdaac4248387","observation_id":"2ddd5d4f-bc6b-4752-958a-3c196629d5fd","resolution":{"observed_at":"2026-08-07T04:46:05.131868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.111088Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"a8a446d2-62c5-473a-b7ef-89c2bd74ff38","year":2021},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.744419Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:c755240b64261a8373dbf4fb15699a06f5ba75e404fc1819021c1175433387cf","observation_id":"4a37c920-5726-402b-9940-466c6bb4effb","resolution":{"observed_at":"2026-08-07T04:46:05.116365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.095554Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":"80447af0-9336-47c0-9257-3584de4af2e3","year":2019},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.749038Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:da90affa25b07627726bb23c908771685b678fb4d2b826c540e1eb54b60bff42","observation_id":"c2378fd2-e3ac-4f81-96a9-249ff3ea9aac","resolution":{"observed_at":"2026-08-07T04:46:05.100660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.079479Z","title":"Separate in the speech chain: cross-modal conditional audio-visual target speech extraction,","venue":null,"work_id":"6500dd76-95d8-413d-ab57-70bbbc52bf1d","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.754727Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:f6afd9cbd42ec6ec22529ac36c7b956c8ece127d3a5813e23c6e23b8421a4715","observation_id":"cccba63c-671b-4ce4-a72c-1fa36577a663","resolution":{"observed_at":"2026-08-07T04:46:05.084425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.759101Z","title":"V oxceleb2: Deep speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.759101Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:6e4510586e7d1dfd78511e7f886179ebe57a6fd60051486f0a09480b8c6b1e4b","observation_id":"9e63d60d-5eac-43ff-b8f5-113ff6fe942a","resolution":{"observed_at":"2026-08-07T04:46:04.759101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.052879Z","title":"Watch or listen: Ro- bust audio-visual speech recognition with visual corruption mod- eling and reliability scoring,","venue":null,"work_id":"cec315a3-2f96-4706-9d7c-2d68bb84abd5","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.763651Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:9957f674aa3c40c2c11357ffa3a5790be6041d272a88d73f9cd53f33db929a5f","observation_id":"cf384b2e-344f-4da7-a016-6670a52231d2","resolution":{"observed_at":"2026-08-07T04:46:05.058171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.037528Z","title":"Lrs3-ted: a large- scale dataset for visual speech recognition,","venue":null,"work_id":"4ef07974-cf5c-4169-ae26-14b1c6de627c","year":2018},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.768090Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:e16fb2be230039617ad0fb925415cbff354dfc1a8de581464d090d03a132a94f","observation_id":"8f3733b2-e3a8-4f34-9193-24faa3e99dcd","resolution":{"observed_at":"2026-08-07T04:46:05.042463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.022391Z","title":"Sdr – half-baked or well done?","venue":null,"work_id":"143f37dc-86a5-4d66-935d-d111431c5005","year":2019},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.773088Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:254836a5fd12e95d57d3782b93a265afcebabef760940ba6cdd5c972bcb0c092","observation_id":"df70e485-3872-4cd2-b00f-2584726a6d38","resolution":{"observed_at":"2026-08-07T04:46:05.027505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.6350","last_updated":"2012-12-27T11:31:16Z","snapshot_observed_at":"2026-07-06T03:02:52.979669Z","submitted_at":"2012-12-27T11:31:16Z","title":"Single-sided Real-time PESQ Score Estimation","version":1},"cited_work":{"arxiv_id":"1212.6350","doi":null,"metadata_source":"pith","pith_arxiv_id":"1212.6350","snapshot_observed_at":"2026-08-07T04:46:04.849447Z","title":"Single-sided Real-time PESQ Score Estimation","venue":"cs.SD","work_id":"66788e45-1806-4c1e-b5af-4302a25d0b55","year":2012},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.777432Z"},"links":{"cited_paper":"/paper/1212.6350","citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:a8a28c3f327422681b3af4b66cbbe77974ce31268cacc1df7d061a65a98615bb","observation_id":"d35c370d-25fb-4aa2-92c0-6f0d5cbb1174","resolution":{"observed_at":"2026-08-07T04:46:04.857164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:05.006180Z","title":"An al- gorithm for intelligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"96192bf6-30cf-4bcd-b453-51517c84ff90","year":2011},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.782208Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:74878e51b5268414ea44e79295977e73e73c2a13d575d3c21d371970dae94c6c","observation_id":"d0040916-1427-4b42-8027-a37154c8e2ae","resolution":{"observed_at":"2026-08-07T04:46:05.011753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.990962Z","title":"SpeechBERTScore: Reference-aware automatic evaluation of speech generation leveraging nlp evaluation metrics,","venue":null,"work_id":"d1861b50-5ecb-422d-9739-9505473605e3","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.787637Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:637454ae544109d128c5266539a5151f05b30ec5b7e3184f9d52568fa781d4f8","observation_id":"2feebede-1b54-43ca-a246-0f0eb293d75e","resolution":{"observed_at":"2026-08-07T04:46:04.995934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.973642Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"133e3f8f-8225-4cda-ba4b-ec4f4bf384ef","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.792441Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:64ea56fe7fa3dba6248655764c6a47c7ab19bb223df57cfe155012ca076e8383","observation_id":"e82f49b8-00ac-4725-ad93-a1c3d3503b1e","resolution":{"observed_at":"2026-08-07T04:46:04.979381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.957843Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"830d441a-f1cc-47e7-9b4e-59dd1882c865","year":2006},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.797897Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:87bc4ac42d6304d3911a13a85e31fdcec46750d5795b4f0ec0342c2c985d0664","observation_id":"673af5ad-5b81-4606-a91d-8a5f8194060c","resolution":{"observed_at":"2026-08-07T04:46:04.962900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.941423Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"e0aba799-e51c-4fc6-a183-c91d951e18dd","year":2020},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.802382Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:9d4b9103d5f296481ffeacc7124d2e0c488671f239cf5f853f2fd70d407dcac1","observation_id":"5426972f-cbe5-4462-b88d-d586d4b961b1","resolution":{"observed_at":"2026-08-07T04:46:04.946664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.924512Z","title":"Learning audio-visual speech representation by masked multimodal cluster prediction,","venue":null,"work_id":"c2a69ac9-2cba-4051-b092-ca8d1444394f","year":2024},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.806966Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:2fd12e05895dd07e32bb5e1225b074d92b7199500c774fc0d75d049c7807f42a","observation_id":"c5af5730-58c1-48f1-870e-a77dab4ef6d3","resolution":{"observed_at":"2026-08-07T04:46:04.929645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:46:04.908698Z","title":"Intuitive multilingual audio- visual speech recognition with a single-trained model,","venue":null,"work_id":"80909ba6-25a4-4d96-b0e7-c17275c61bfe","year":2023},"citing_paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:46:04.812385Z"},"links":{"citing_paper":"/paper/2506.09792"},"observation_digest":"sha256:b74aa655e89f3dcb68dcea1a2beb8ec77f1a37772ab8adffda6bce242c87574a","observation_id":"4ac4cd68-4834-42c4-8b31-c4753ab3a989","resolution":{"observed_at":"2026-08-07T04:46:04.913816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.09792","last_updated":"2025-06-15T08:24:31Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T04:38:07.208263Z","submitted_at":"2025-06-11T14:36:26Z","title":"Incorporating Linguistic Constraints from External Knowledge Source for Audio-Visual Target Speech Extraction"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2506.09792."}