{"as_of":"2026-08-11T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87e3e47e1c9d32cad32698060c8b236c7f5d9fec0bdf7176cabdb81dab91ddbb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:38:54.409813Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03964/citation-record","integrity":"/paper/2608.03964/integrity","json":"/paper/2608.03964/citation-record.json","paper":"/paper/2608.03964"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.211546Z","title":"ACM Transactions on Graphics , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.211546Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:c0a9c4262c6d5744e0fb0b6a5ff0d418478af1a004f9077442dc960a2764e694","observation_id":"112c890a-9b33-4f67-b96c-f88dd6add5c8","resolution":{"observed_at":"2026-08-08T00:38:54.211546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.216918Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.216918Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:d0f2ad5e802c8b77d5b5e51123ac38c9cf3a591fd1344b63c0a55129bb45a072","observation_id":"1b927815-17bc-4886-93d9-8328dba9f8f2","resolution":{"observed_at":"2026-08-08T00:38:54.216918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.220345Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.220345Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:7cfd8471b0d284a0c327708380c66e25403c38a8a96e508f4c68349f79a1c41e","observation_id":"7e894187-9100-46a6-8547-10060c2cb37e","resolution":{"observed_at":"2026-08-08T00:38:54.220345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.223368Z","title":"Interspeech , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.223368Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:c47f8a71d49f4102248d2d535a78e7461edb2b8dee13322e39204a798eabb440","observation_id":"a800df13-33f0-4c3c-a4f2-850072516a9c","resolution":{"observed_at":"2026-08-08T00:38:54.223368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.226354Z","title":"2022 , doi =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.226354Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:f33a8b9a478a6ac20f6fbafc4c62ac4c10a0b5874799bef9b1b7cb1aefaf567e","observation_id":"61dd3564-683a-450b-845d-d1287cf94a61","resolution":{"observed_at":"2026-08-08T00:38:54.226354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.230320Z","title":"2019 , publisher=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.230320Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:581ca914450c2c211a78c74b4e9cb3daeeb53159b18445dc19295bfd56a338dc","observation_id":"60a2f955-fd1c-414c-84b4-e3f86d41a8db","resolution":{"observed_at":"2026-08-08T00:38:54.230320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.234316Z","title":"IEEE/ACM Transactions on Audio, Speech, and Language Processing , volume =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.234316Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:498058a798f541e56abc45763ae1f7f2defa51de0a0823dd07072819556e7824","observation_id":"b1da064b-7657-4104-8e98-88b95502d472","resolution":{"observed_at":"2026-08-08T00:38:54.234316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.238054Z","title":"Interspeech , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.238054Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:dc720447eb04726539cb6584110d04e5e21d56cc8850785c8aa1a345ad3e4e19","observation_id":"79a3f8dc-cd62-4314-9f00-1e1d96af9493","resolution":{"observed_at":"2026-08-08T00:38:54.238054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.241584Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.241584Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:7fd32098432cdd04dc3066313f4c184f36d43e957d40ae9a3aff4874fc0ce60b","observation_id":"20b3a242-fc20-4c28-9ed8-f26fd7675079","resolution":{"observed_at":"2026-08-08T00:38:54.241584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.245641Z","title":"2018 , doi =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.245641Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:57a990d7bb32dbc8e0f786dc8c7921a9896f49aa7853144f8aabe4eb463154c5","observation_id":"2194eccc-70b0-434a-b99e-f97e018babd5","resolution":{"observed_at":"2026-08-08T00:38:54.245641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.249341Z","title":", booktitle =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.249341Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:778210ba4379899db3885e69a134bb271b9b7a520324f985caeaaaa0e0574f41","observation_id":"d1d82b5c-84ad-4417-9f7b-419d06fa569a","resolution":{"observed_at":"2026-08-08T00:38:54.249341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.252885Z","title":"2017 , doi =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.252885Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1264943fd8655bff721bd390ae5e5a46e28cff7a7b05246fa5b9459cf1c096bd","observation_id":"539382fb-ce8d-46d8-a2ae-417fbefb4304","resolution":{"observed_at":"2026-08-08T00:38:54.252885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.256292Z","title":"2023 , doi =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.256292Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:a9dccbb2a1afb4aa388b07aefca423e578aa0a88bdbf6a4e90e6b1d8152024a6","observation_id":"7a3a86a3-2fcf-41b5-9193-2af8c5f0e682","resolution":{"observed_at":"2026-08-08T00:38:54.256292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.259841Z","title":"Scenario-Aware Audio-Visual","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.259841Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:f07e5cd599fc8e6ef6a141e2f2f0e7c33ae2b5df40c81b56c65d13b626cc5f6b","observation_id":"ad1c46d9-1b70-4424-8411-d6c996dd1d43","resolution":{"observed_at":"2026-08-08T00:38:54.259841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.263337Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.263337Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:db64261cdab6dd599246ab68b51a76b93b21025c182871a899caec43ccfedbe6","observation_id":"1d007458-36a0-48fd-9d24-6c4607fd5b62","resolution":{"observed_at":"2026-08-08T00:38:54.263337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.266927Z","title":"2018 , doi =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.266927Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1ca607d7d80249660b22ccb9aadda7fb754c597408a5748fa25eb39d188a2e58","observation_id":"e88cb523-481f-4f3f-be00-5b88767ba1c1","resolution":{"observed_at":"2026-08-08T00:38:54.266927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.270343Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.270343Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:526c4f6769380adee87f94c93018b52ba28dc871e032a1b76397488511d99cbd","observation_id":"3f31e0d4-41af-40d5-93f5-3a3e0df90af0","resolution":{"observed_at":"2026-08-08T00:38:54.270343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.274039Z","title":"2020 , doi =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.274039Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:2fbd3f48b09b7c4bb3f9514c4e697ff7b141fc0c909a0275eea023051b129892","observation_id":"ef4f2bf9-77aa-4a9e-8de0-12b4b396d984","resolution":{"observed_at":"2026-08-08T00:38:54.274039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.277716Z","title":"IEEE International Conference on Computer Vision , pages =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.277716Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:55e49f2599c6a02f8ea9753692e676c9ab30166df45b64c812751f93506a49ef","observation_id":"4266f7a6-6c7c-4505-9e9b-285d22f33640","resolution":{"observed_at":"2026-08-08T00:38:54.277716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.281291Z","title":"2015 , doi =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.281291Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:0e4729009e5a8c060e8ac8f41349586577f475930d8c81e5662d855f4874d07a","observation_id":"6f8e3df5-751c-4209-8af3-da698735f802","resolution":{"observed_at":"2026-08-08T00:38:54.281291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.285144Z","title":"and Zisserman, Andrew , booktitle =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.285144Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:fb03f029f51c10de5be36ba997c4b1b5614738651829110e4577f65943d3418f","observation_id":"807b4805-0e65-461e-aa90-f9a65874a224","resolution":{"observed_at":"2026-08-08T00:38:54.285144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.289014Z","title":"IEEE Transactions on Information Theory , volume =","venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.289014Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:6d6b7516f722445b975ef08b827d1f5115ebe7c4c96116827db8e88ec004da9f","observation_id":"ab9bbf30-5cc8-4f92-b1bd-abca76a9406e","resolution":{"observed_at":"2026-08-08T00:38:54.289014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.292831Z","title":"ACM Multimedia , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.292831Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:193fe68cc097c5443aab6127e83df64b58112788ef35b1f873a3cf92a13dcaa9","observation_id":"5984d529-99f9-419b-a51a-12911f513f01","resolution":{"observed_at":"2026-08-08T00:38:54.292831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.296240Z","title":"The Annals of Statistics , volume =","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.296240Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:22028612e8e537521950d715e2ce515a0cc1cf0b58b8deaf2ba4230cc37fd77b","observation_id":"28122e67-d504-4689-9c89-c85ca1dddeed","resolution":{"observed_at":"2026-08-08T00:38:54.296240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.308651Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.308651Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:49f60a2a47f5b230650cb35516c78a93379d7d75a792474dec0b10f488227c94","observation_id":"a02291c4-9efc-460e-99ac-86008ad23aab","resolution":{"observed_at":"2026-08-08T00:38:54.308651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.311963Z","title":"2026 , doi =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.311963Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1cb80c0357ff730028217bb6e8fe50339d21987604ec1d8dea22c0b39d7e4745","observation_id":"03294fde-dc69-438b-a96b-649434e648de","resolution":{"observed_at":"2026-08-08T00:38:54.311963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.315406Z","title":"2025 , pages =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.315406Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:4d5d72ad732d6a95b1a412d3945d29376708a908413aa6fd2cc81a635b693a72","observation_id":"7b468ec1-be23-4dfc-8e6b-404de216cc77","resolution":{"observed_at":"2026-08-08T00:38:54.315406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.318691Z","title":"ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.318691Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:431db80ff3c8028bc02af4b0e38d259e96b629f41ba90a9daf84a21bfe33b854","observation_id":"b333e601-2da3-4327-8a19-d5cfc83df7de","resolution":{"observed_at":"2026-08-08T00:38:54.318691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.00496","last_updated":"2018-10-28T14:29:46Z","snapshot_observed_at":"2026-07-06T06:58:51.877372Z","submitted_at":"2018-09-03T08:38:34Z","title":"LRS3-TED: a large-scale dataset for visual speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.00496","snapshot_observed_at":"2026-08-08T00:38:54.321955Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.321955Z"},"links":{"cited_paper":"/paper/1809.00496","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:7b6b8729499aafc2513d045bf5b9f87dbd143d267dd2255b81b2dfd8d805cb4f","observation_id":"86254853-121b-4cfb-a3a2-9fd481c3351c","resolution":{"observed_at":"2026-08-08T00:38:54.321955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.325800Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.325800Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:464eeaf8d7a77b82ec9356c13c1ed3ff3d2e203ed23d42ee149a98ac42314fd5","observation_id":"474d28ca-f1d0-43b0-993b-49d471749e2c","resolution":{"observed_at":"2026-08-08T00:38:54.325800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.329420Z","title":"Parkhi, and Andrew Zisserman","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.329420Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:40c1774f2b5c7d05a0ae1aa5021da6e5c71ec8863aef1527296b90aff69c6768","observation_id":"0a328093-3103-4743-9785-21100acc16f8","resolution":{"observed_at":"2026-08-08T00:38:54.329420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.333168Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.333168Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:da6d97da716153d9f2046c085fc8206ca869d23259277f8121cffe0723035a5b","observation_id":"65c05404-29c9-4730-bba4-30d59e2db9d7","resolution":{"observed_at":"2026-08-08T00:38:54.333168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.336600Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.336600Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:7e737127f0856d6f42c073ce525488fa0fb7d7fcfac17c60ddc26d7f667b5a9c","observation_id":"8f61b9d5-5d86-4ab4-afb3-33107d51200a","resolution":{"observed_at":"2026-08-08T00:38:54.336600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.339648Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.339648Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:9bf19daf5fc14c5a6cb9c20e930036927c650d18797bbee63824b88509cd1be5","observation_id":"313acf9d-0870-4420-abe3-4b99a0d74da6","resolution":{"observed_at":"2026-08-08T00:38:54.339648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.342520Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.342520Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:3c16fa2106f7a844f9a9d01983168e54bd5aad447d3dae18a86cbc17784cee62","observation_id":"ea59e885-92f5-4560-a346-74d4ce5299b2","resolution":{"observed_at":"2026-08-08T00:38:54.342520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.345337Z","title":"Freeman, and Michael Rubinstein","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.345337Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1754028943ab98178122243afb3632be65870577d457509b9b8fbc63ff8cc047","observation_id":"bb2f8a39-2f60-4774-bd1c-231f8f3b3861","resolution":{"observed_at":"2026-08-08T00:38:54.345337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:55.206024Z","title":null,"venue":null,"work_id":"0ad5a703-fbdd-415d-9949-d44e3f1a2ef5","year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.348174Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:0619f49459ef3f5f53abf950780b3d009b0a454fd50b9970b11f268bb8d14199","observation_id":"96e1c602-b0f3-4613-b820-20faf5b74c85","resolution":{"observed_at":"2026-08-08T00:38:55.208961Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.351032Z","title":"Levenshtein","venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.351032Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:e42da68fb5537d70a4a10be957685aa10d61dace30014dffdd480a008331d2d0","observation_id":"46ca842a-cc4c-49d1-9e69-0373a9275f21","resolution":{"observed_at":"2026-08-08T00:38:54.351032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.353708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.353708Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:5063872c20ea26db69d1581c161a24fe18d20d11d49270142fcb6bfe6c649625","observation_id":"f662acfe-81d3-45c6-b467-6f7ec3a4da23","resolution":{"observed_at":"2026-08-08T00:38:54.353708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.356936Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.356936Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:fa3bd65ef3d0d26d14f1231e092735050b85c3126fd8f9fc5ee49320947511e3","observation_id":"044b5cc1-d2ee-45b1-9a6b-03240fad9dde","resolution":{"observed_at":"2026-08-08T00:38:54.356936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.359955Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.359955Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:6d9a7ede5ec566f86c2fa80f6b7c68c5b12bc3b45ab7b0f89d2599abfdc82f56","observation_id":"5ed23fc1-67b8-474b-ac58-dba8ecfaf0ca","resolution":{"observed_at":"2026-08-08T00:38:54.359955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.363402Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.363402Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1d09f97cf0213ed3a670a1b48d3dff12cddf6d7c5bffa1e1f61c81f242fe6021","observation_id":"042ccf02-0a6f-4e25-b1fe-615dfb96d307","resolution":{"observed_at":"2026-08-08T00:38:54.363402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.366914Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.366914Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:3a706637d51d6e82217c915b8393712d271498504c59c3911a6f7e7e046e4da8","observation_id":"61a2b157-5986-4c77-9182-5c40862a7f61","resolution":{"observed_at":"2026-08-08T00:38:54.366914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.32057","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:55.089341Z","title":null,"venue":null,"work_id":"6847bf2e-c6de-488e-a1a8-2ca7cec05ad6","year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.370357Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:959072b465950a9ee2724298a4c531b0fb99de3a03592c62c479f074d307fa23","observation_id":"92025b76-f9ab-4d82-832e-057e8e627e9b","resolution":{"observed_at":"2026-08-08T00:38:55.094647Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.373896Z","title":"Germain, Sameer Khurana, Chiori Hori, and Jonathan Le Roux","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.373896Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:1479fea0cc90179c6e28e14153b89533860e2842d5a2dd738c373734a8a876dc","observation_id":"94bb6707-9a05-4651-94e0-7ac82a880576","resolution":{"observed_at":"2026-08-08T00:38:54.373896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.377234Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.377234Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:664e0357a88f3542f7051a3c87270b8f5fea81b21194a48fbc558acdcbfb5242","observation_id":"124d17c8-d2f7-4916-aa70-48a6b57d695c","resolution":{"observed_at":"2026-08-08T00:38:54.377234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.380506Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.380506Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:f8f54fbeb1286458205d0f840cc4a0769e1d4fa79c9124148f97d98fffbaafde","observation_id":"0308c74e-745e-4bdb-80a9-fc395a666122","resolution":{"observed_at":"2026-08-08T00:38:54.380506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.383895Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.383895Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:0fe80bc47860dad48660c549cc4547cbb85b4718da552b524100a4e8860135c0","observation_id":"137980d6-499a-466b-8246-37875d31c9a0","resolution":{"observed_at":"2026-08-08T00:38:54.383895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02184","last_updated":"2022-03-13T01:52:28Z","snapshot_observed_at":"2026-08-11T09:07:04.259568Z","submitted_at":"2022-01-05T17:40:45Z","title":"Learning Audio-Visual Speech Representation by Masked Multimodal Cluster Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02184","snapshot_observed_at":"2026-08-08T00:38:54.387173Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.387173Z"},"links":{"cited_paper":"/paper/2201.02184","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:c9175556db8a320ebe3bc89b8e858873ff1ebda9e7154e7251432457eed0fc95","observation_id":"f48c3caa-2414-4616-9134-fb48b647a39f","resolution":{"observed_at":"2026-08-08T00:38:54.387173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-08T00:38:54.390520Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.390520Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:30ab64553abe7c5f59687e5e6e1d848899c5e961b113cea624abbd0f346d0dfd","observation_id":"5862b241-aec2-4ec6-929c-eb3016af799b","resolution":{"observed_at":"2026-08-08T00:38:54.390520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.05763","last_updated":"2026-06-04T06:44:54Z","snapshot_observed_at":"2026-08-08T06:14:05.969071Z","submitted_at":"2026-06-04T06:44:54Z","title":"M2S-AVSR: Modality-aware Multi-view Self-supervised Representation for Robust Audio-Visual Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.05763","snapshot_observed_at":"2026-08-08T00:38:54.394031Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.394031Z"},"links":{"cited_paper":"/paper/2606.05763","citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:62c69b3409bdfcc8a866ed74145e4f31aac396f3e6ba56891ab0db0d4f48def8","observation_id":"90aa7cfb-9ff0-4588-8bc7-9aca6531904e","resolution":{"observed_at":"2026-08-08T00:38:54.394031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.397062Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.397062Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:00d75c47e9781878b394c0515f8e37eee21b7f1d522f045f4c219c1156ea7e0a","observation_id":"2524002a-08e6-4e81-966b-538796c011ba","resolution":{"observed_at":"2026-08-08T00:38:54.397062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.400282Z","title":null,"venue":null,"work_id":null,"year":1967},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.400282Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:bf6c2505facf4c7f7def07af79e7a75f0e31505b39f282c2461999210af93adf","observation_id":"f153512a-cb7b-4cd9-a6db-55261bd5f2c3","resolution":{"observed_at":"2026-08-08T00:38:54.400282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.33044","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.697477Z","title":null,"venue":null,"work_id":"25d05e66-0db8-4585-b370-87ea115b6503","year":2023},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.403395Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:80a74cc4e9b3dfaa1ecadcb9f58bac76b8b305ac6dc561fa8723af13fc3a2bc4","observation_id":"b0693668-e234-4b58-b3d5-4e5d405ea64d","resolution":{"observed_at":"2026-08-08T00:38:54.704054Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.406547Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.406547Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:161e3aed7e7f7e7105f3070b84a6da8c5ae49dbd1f6430f1772bc92429b9d051","observation_id":"69a62879-b9c3-403c-8956-f050ccbad675","resolution":{"observed_at":"2026-08-08T00:38:54.406547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:38:54.409813Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-08T00:38:54.409813Z"},"links":{"citing_paper":"/paper/2608.03964"},"observation_digest":"sha256:106f52bde128ba42264305b28d8691a22bdfe914a11525f0cad82227d364ba02","observation_id":"3fa79b04-247c-4abe-bdf6-87be5cef118c","resolution":{"observed_at":"2026-08-08T00:38:54.409813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03964","last_updated":"2026-08-06T06:35:08Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T23:10:08.025956Z","submitted_at":"2026-08-04T17:28:41Z","title":"Identity-Faithful Audio-Visual Target Speaker Extraction with REAL-2MIX and VOXBLINK2-AVSE"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":53,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2608.03964."}