{"as_of":"2026-08-15T07:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:397cbf16c5958be936e2f098bd170a3933b65cf903126ab4a1b0931da201cfc0","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:05:39.516845Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:23:24.503068Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T19:26:55.801813Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T12:23:24.503068Z","title":"Di- CoW: Diarization-conditioned whisper for target speaker auto- matic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24545","last_updated":"2025-05-30T12:53:27Z","snapshot_observed_at":"2026-08-13T20:25:21.217716Z","submitted_at":"2025-05-30T12:53:27Z","title":"Pretraining Multi-Speaker Identification for Neural Speaker Diarization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:23:24.503068Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2505.24545"},"observation_digest":"sha256:b0fad9c0cd9346dee9d7d24eb25b0ef9189f842825a0c0a816d0c1637f4c21e7","observation_id":"4fd78155-4eda-4b50-bdae-3aa0155d3660","resolution":{"observed_at":"2026-08-07T12:23:24.503068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-07T00:50:17.227570Z","title":"Di- cow: Diarization-conditioned whisper for target speaker au- tomatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12672","last_updated":"2025-06-15T00:37:27Z","snapshot_observed_at":"2026-08-11T06:45:33.799302Z","submitted_at":"2025-06-15T00:37:27Z","title":"SC-SOT: Conditioning the Decoder on Diarized Speaker Information for End-to-End Overlapped Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:50:17.227570Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2506.12672"},"observation_digest":"sha256:8950cecfb3d9c99f9cffba0e3b4b2ed5d6998425e24cc362ead26ce4b6718a0e","observation_id":"33eeac7b-ef79-4c00-9143-2aa993c6071f","resolution":{"observed_at":"2026-08-07T00:50:17.227570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"cited_work":{"arxiv_id":"2501.00114","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00114","snapshot_observed_at":"2026-08-06T19:26:55.801813Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","venue":"eess.AS","work_id":"0b21dc5f-b145-4669-b594-aa61ac1f163b","year":2024},"citing_paper":{"arxiv_id":"2507.05609","last_updated":"2025-07-08T02:37:20Z","snapshot_observed_at":"2026-08-14T15:26:00.046501Z","submitted_at":"2025-07-08T02:37:20Z","title":"MMW: Side Talk Rejection Multi-Microphone Whisper on Smart Glasses","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:53.977592Z"},"links":{"cited_paper":"/paper/2501.00114","citing_paper":"/paper/2507.05609"},"observation_digest":"sha256:e87a68dc1afe3243effa38e9c6f09a962ff8603045cb378f639c251340e1574a","observation_id":"19f421df-b12b-40bc-a020-db724361690f","resolution":{"observed_at":"2026-08-06T19:26:55.924144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.00114/citation-record","integrity":"/paper/2501.00114/integrity","json":"/paper/2501.00114/citation-record.json","paper":"/paper/2501.00114"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.998640Z","title":"Li, et al., Recent advances in end-to-end automatic speech recogni- tion, APSIPA Transactions on Signal and Information Processing 11 (1) (2022)","venue":null,"work_id":"ee631779-7442-4cd0-bafc-bf8761fb26f4","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.240662Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:9687b8557df1eabe1b835c74ca53ab494a92c9c12765a490fdf8af13cd457c51","observation_id":"064d8f14-b9bf-40c5-9927-67be6a01f4e3","resolution":{"observed_at":"2026-08-10T23:05:41.004490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09249","last_updated":"2020-05-02T11:04:49Z","snapshot_observed_at":"2026-08-06T07:30:18.680662Z","submitted_at":"2020-04-20T12:59:07Z","title":"CHiME-6 Challenge:Tackling Multispeaker Speech Recognition for Unsegmented Recordings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09249","snapshot_observed_at":"2026-08-10T23:05:39.246159Z","title":"Watanabe, M","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.246159Z"},"links":{"cited_paper":"/paper/2004.09249","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:4c3a4affd1aa89a76fa03abde4406ec881baa828fe79ab529713b37b65a16747","observation_id":"32956857-4de7-4dd7-8700-e2a82fc35d4d","resolution":{"observed_at":"2026-08-10T23:05:39.246159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2023-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.869626Z","title":"Cornell, M","venue":null,"work_id":"b706c182-6266-4f8e-843c-93da118fba3a","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.257344Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:c83b12353da20d7e32d8fe3c910e6854c647620caba81d335c75b9c7bb78df27","observation_id":"22b1ebc8-e1f4-42d9-904b-64532d14a419","resolution":{"observed_at":"2026-08-10T23:05:39.874834Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-1","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.853689Z","title":"Cornell, T","venue":null,"work_id":"31c8c77c-194e-4de2-9304-99179145e8fb","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.262373Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:2f7cf928a60c0fefe1b340a3310ffb06d46c56fca5a3cabb39149aa14db00fe9","observation_id":"d1c7eb07-7f28-42e5-ab5f-f6de6af44305","resolution":{"observed_at":"2026-08-10T23:05:39.858789Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03930","last_updated":"2025-02-24T19:37:06Z","snapshot_observed_at":"2026-08-14T14:25:15.221789Z","submitted_at":"2024-10-04T21:13:58Z","title":"Reverb: Open-Source ASR and Diarization from Rev","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03930","snapshot_observed_at":"2026-08-10T23:05:39.267220Z","title":"Bhandari, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.267220Z"},"links":{"cited_paper":"/paper/2410.03930","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:5ed497ba11f10510a89b4b99e489e6f3299ef85608ecfd60732d917f79448125","observation_id":"0c7488d4-f5f3-41a7-b7a5-3d0814f8b844","resolution":{"observed_at":"2026-08-10T23:05:39.267220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.272963Z","title":"Yoshioka, I","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.272963Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:8ff9534e08f4b809d87bfb2fb03e799b02348f1e1a27e1c8684e2ebd90d9a943","observation_id":"767fc39e-7eca-43f1-8009-0529e75d2908","resolution":{"observed_at":"2026-08-10T23:05:39.272963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.278318Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.278318Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e6f0c8fbb42e58b05ac871c729c33abc2fc89860f492b8e26675ac98e33e4396","observation_id":"304020ac-f9d4-48b3-9bb7-6a1073c03209","resolution":{"observed_at":"2026-08-10T23:05:39.278318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2019-1126","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.731187Z","title":"Kanda, S","venue":null,"work_id":"d5d281b5-3324-479b-9fb5-05c863efafd1","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.283271Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:75de5a4ee0efee20f5ce394e5697632e80154908ce6c98566db97050f92c47b0","observation_id":"b7b9c6ee-0edb-44cf-8c62-b7e0eb06333c","resolution":{"observed_at":"2026-08-10T23:05:39.736184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.982871Z","title":"Karafi´ at, L","venue":null,"work_id":"ffc63092-ea2f-4468-b1d9-f0b718298f30","year":2011},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.288277Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:498d517c0c6c70f79c17f5931c3be24d92438a4a349e0e9b3152c2d4479565d3","observation_id":"35f87962-629f-464e-96b7-c05ceb8bd7d3","resolution":{"observed_at":"2026-08-10T23:05:40.987827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.298540Z","title":"Dehak, P","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.298540Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:b7f5e38698ecb4dce1ed39c6608a1083c7b8e9f9694666eec983015b200fface","observation_id":"84e3e55b-36ba-43e9-96cb-32072c9814f6","resolution":{"observed_at":"2026-08-10T23:05:39.298540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.304067Z","title":"Snyder, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.304067Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:cb5098252dea2b883e76e21adf34dbfa81aa7c8896621e827a4bfe0b4fe4a319","observation_id":"4c2d04e6-c3e5-4876-8193-d86cde3522d2","resolution":{"observed_at":"2026-08-10T23:05:39.304067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.946562Z","title":null,"venue":null,"work_id":"a33b87c8-d6a8-4a9d-a28c-4896c693a463","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.308653Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:9308c4c560388cbcda3b026d65612fee8ea0276106099c2ada673bb673d44be8","observation_id":"827f3c82-fc50-4546-9bc4-dd98456e0e47","resolution":{"observed_at":"2026-08-10T23:05:40.951865Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.313547Z","title":"Radford, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.313547Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:ddc2ea9d595fb540940681a733b840e238d2f46161eefb2c75b0d555823d4bda","observation_id":"155fe754-c5e5-48f7-9c8b-c739a4216752","resolution":{"observed_at":"2026-08-10T23:05:39.313547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.318226Z","title":"Vinnikov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.318226Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:917c863a090251b8b35010818205a08c0cf6ca9f83bd9c7a96fda3054e324473","observation_id":"647c51e5-7d89-40c4-94aa-f2270dc33c76","resolution":{"observed_at":"2026-08-10T23:05:39.318226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.920243Z","title":"Mccowan, J","venue":null,"work_id":"7c963cac-7cbb-4ec6-948a-f244a04b560a","year":2005},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.323191Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:69eb8613471124afbceaeaaf59ab92e7547df6c9869cd5ac9e265176cfd2a426","observation_id":"df418fcb-55c9-4b35-8393-8095a167cfe0","resolution":{"observed_at":"2026-08-10T23:05:40.925070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.905149Z","title":"Cosentino, M","venue":null,"work_id":"220d0e78-72d9-456f-88b7-da1d9a883d25","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.327825Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:1e98f2d0102bcd38e83e1ac62b0d1d66695c3f4b07cd5daa0ca4f36da9adc0c5","observation_id":"4fa9dd60-8f3c-4530-83bb-36cacd5e80ab","resolution":{"observed_at":"2026-08-10T23:05:40.909958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.888166Z","title":"Kinoshita, M","venue":null,"work_id":"36aa9f2f-98f1-459e-9cd8-81d7772c7005","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.332251Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:ca1eb4ef3b5ce9ad6118a3a9a96923793dde935dd28ace6d75244826a3b3cdcb","observation_id":"268b19a0-188a-4fa9-b1b1-229356d50006","resolution":{"observed_at":"2026-08-10T23:05:40.893821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.871238Z","title":"Bredin, pyannote","venue":null,"work_id":"b4163188-287c-42d8-a7b0-a76600292955","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.337358Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:ddc4faac80e09d814cde93dcf69f5b6c0a44572025c87baa1b40839b8193a501","observation_id":"f9552426-1895-49a1-9ebf-ec8e08e7e359","resolution":{"observed_at":"2026-08-10T23:05:40.876113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.855778Z","title":null,"venue":null,"work_id":"a5ea1654-8b9f-4e1f-881c-4520f9aa6c28","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.342167Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e741cda732c4239e6b0e46dd0957466ba727c99d854901b7dd80d0fcbebcab0c","observation_id":"915eaa56-6f48-4974-a696-58313900316d","resolution":{"observed_at":"2026-08-10T23:05:40.860426Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.346985Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.346985Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:77f681fd647ed0db756ff36ed2aec165409ca24fc9acca922832cef067fcf48d","observation_id":"920f8e37-99c2-4972-8739-03c8c28aaf66","resolution":{"observed_at":"2026-08-10T23:05:39.346985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.839257Z","title":"Kanda, X","venue":null,"work_id":"f499764b-01bd-4b39-b6af-c49e9dc87d94","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.351745Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:864bfb64515397deab2ce79eae08625ba77e811d614d84962f7adcf89c99d2b2","observation_id":"46125a7a-58ec-4c29-8d83-a37b6b4cf2e7","resolution":{"observed_at":"2026-08-10T23:05:40.844492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.823210Z","title":"Cornell, J.-w","venue":null,"work_id":"f8f995f5-3b80-4948-83e9-acc706e7d0b8","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.356481Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d447c4f9a4d715008a41ad52e9a93e098fddb0a3c9240a56af56b8a2e813a4e0","observation_id":"485389d2-bf9a-4cb8-93b9-ae6fa56e5b5b","resolution":{"observed_at":"2026-08-10T23:05:40.828359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.805207Z","title":null,"venue":null,"work_id":"db70ed38-1987-45f8-abe6-bff19a035610","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.361320Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d5ea6647ea8a2904c5e72cb3b9f25e7c5b681fe3f9e571c08af82ae9ae98c111","observation_id":"4b9b42a4-45d2-4ff2-b0ab-3cda1921a721","resolution":{"observed_at":"2026-08-10T23:05:40.811535Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-971","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.692827Z","title":null,"venue":null,"work_id":"0295b945-c3d7-4a54-817f-54224d4fee34","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.366022Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:56cadbafb8929e8c310e77afe3e613b01551d1454f1418047da065701cf085d7","observation_id":"c08df716-a03a-4c4c-9332-713c7670b5ed","resolution":{"observed_at":"2026-08-10T23:05:39.697457Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05589","last_updated":"2024-12-07T08:53:37Z","snapshot_observed_at":"2026-08-13T07:36:04.074650Z","submitted_at":"2024-12-07T08:53:37Z","title":"SQ-Whisper: Speaker-Querying based Whisper Model for Target-Speaker ASR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05589","snapshot_observed_at":"2026-08-10T23:05:39.370841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.370841Z"},"links":{"cited_paper":"/paper/2412.05589","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:72cfb1735fec61146642ce91ace8402f28adb31f3f3c8ddf684f278ac3d2a953","observation_id":"a1bc5c05-58e3-40ef-8a58-9a3409ec2415","resolution":{"observed_at":"2026-08-10T23:05:39.370841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.376201Z","title":"Vaswani, Attention is all you need, Advances in Neural Information Processing Systems (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.376201Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:fba6a3c721c449674acafa1101388503aaed127238f70ef5456fcf147597b258","observation_id":"70cc3420-629c-477b-b0d3-d979b0b20bf7","resolution":{"observed_at":"2026-08-10T23:05:39.376201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00430","last_updated":"2023-11-01T10:45:07Z","snapshot_observed_at":"2026-08-13T05:35:04.248097Z","submitted_at":"2023-11-01T10:45:07Z","title":"Distil-Whisper: Robust Knowledge Distillation via Large-Scale Pseudo Labelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00430","snapshot_observed_at":"2026-08-10T23:05:39.380789Z","title":"Gandhi, P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.380789Z"},"links":{"cited_paper":"/paper/2311.00430","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:43701ead2dd09e00849d199c1f87e36c347dc1689f7d543d090565d3ca030f8f","observation_id":"36578a4d-00d3-4bdf-990d-c4075d6719a1","resolution":{"observed_at":"2026-08-10T23:05:39.380789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.777806Z","title":"Watanabe, T","venue":null,"work_id":"15c17595-c162-460a-bd87-c0f2adc9fd9e","year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.385781Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:bf44e1ecaf328d0c864a68182616bd0fc8284a8f32b43aaf2e2652edb58ee7a1","observation_id":"d9ea05b8-ec88-4549-b4db-42fcd46165d5","resolution":{"observed_at":"2026-08-10T23:05:40.782690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.390516Z","title":"Graves, S","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.390516Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:6b790186c5bb7e79df64e9ea106963d4b69cd8fda52e31892a803bc41a1aee6b","observation_id":"14bb581b-af9e-454d-807d-cd800ddfcb76","resolution":{"observed_at":"2026-08-10T23:05:39.390516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p17-1048","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.677691Z","title":null,"venue":null,"work_id":"c5c33890-6451-4f8e-a3d8-1d14cf047602","year":2017},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.395342Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:8e31acf3c1de7cfc4a08b03591fbc00b18b9da909c88289ee72064842e4a82cf","observation_id":"c664f6a0-cc54-4345-b47d-65f0fda85b26","resolution":{"observed_at":"2026-08-10T23:05:39.682547Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.761187Z","title":"Leviathan, M","venue":null,"work_id":"e220640d-2897-415b-8e0c-9bcae7938bce","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.400009Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d42a364fb8afefae654859dbd88c4f8b2fed064196f9a2ba8f596a088d1f8049","observation_id":"2b8c0965-e37a-4ac8-8d36-6743eb3cca85","resolution":{"observed_at":"2026-08-10T23:05:40.766481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.404816Z","title":"Watanabe, T","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.404816Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:3fec9570ec6a4bf2cad8d77b11203de8f3bb7003f8bf62d128a5f9709884b741","observation_id":"74d48550-f11e-4b54-9de3-ca0f308b4055","resolution":{"observed_at":"2026-08-10T23:05:39.404816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09543","last_updated":"2025-01-16T09:51:19Z","snapshot_observed_at":"2026-08-12T22:44:50.228752Z","submitted_at":"2024-09-14T21:46:00Z","title":"Target Speaker ASR with Whisper","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09543","snapshot_observed_at":"2026-08-10T23:05:39.409724Z","title":"Polok, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.409724Z"},"links":{"cited_paper":"/paper/2409.09543","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d5a757c4078d7b900e7d0dbde78b95b6e57c97e152fd470df22b15b8a389b164","observation_id":"aaf3b4a5-3456-4431-a944-2b4e940b24c1","resolution":{"observed_at":"2026-08-10T23:05:39.409724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.745067Z","title":"Horiguchi, Y","venue":null,"work_id":"4e643157-f98e-4c0d-bcf4-633258ba2382","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.415188Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:0c72546bb65d4b78dc089a45e3f7a08292c3b2eef6575d7241d74714f35dd316","observation_id":"8d2631dd-c8d2-41df-aebf-961a2edc77e2","resolution":{"observed_at":"2026-08-10T23:05:40.750333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-1260","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.650341Z","title":"Moˇ sner, R","venue":null,"work_id":"a697dd94-784f-4cd7-af04-ad3899635fb6","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.424979Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:db81517871a0a71a122939c008a0ee4dc32760a485b326e50894fd63b9d0beaa","observation_id":"abe155b3-d97b-4f0c-967c-08c30ff1cc3b","resolution":{"observed_at":"2026-08-10T23:05:39.655233Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.728586Z","title":null,"venue":null,"work_id":"7b725b80-4efc-4b87-8db0-033ea5d02c9d","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.429821Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:178422144d1c3410db3808e5d255fa6a71218da2abeb04a85178047758413e9f","observation_id":"f7f5c7a8-1eb3-4b13-ac36-009ffe0c954b","resolution":{"observed_at":"2026-08-10T23:05:40.733657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2023-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.633022Z","title":null,"venue":null,"work_id":"b4b2d0f4-04a4-48fd-968d-42dd9b63733b","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.434348Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:a93273c7bc9dc5deeeb142a0f66b50ad6f5e5c76e83a20ef943f1cc3d6ca60f6","observation_id":"a97d7c6f-48ac-44b1-aa23-5b1727c9be52","resolution":{"observed_at":"2026-08-10T23:05:39.638371Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.438872Z","title":"Panayotov, G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.438872Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:bceb6eadbc2d77abafe38d1ed62f91a9fe4a8c1c02997f3e43b5f32de2572d21","observation_id":"a9e2c3bb-009f-4020-b83f-1986749ab605","resolution":{"observed_at":"2026-08-10T23:05:39.438872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.710801Z","title":"Loshchilov, F","venue":null,"work_id":"8bb51ff6-c65b-4ffd-b7c8-7ea72fea29ad","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.443694Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:022f88faeff036fd9770b7143ba7af71e7c697921c81f0ac46091726f3b6fed0","observation_id":"bea02136-184f-498f-8de7-4a2eef6963e4","resolution":{"observed_at":"2026-08-10T23:05:40.716649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09408","last_updated":"2024-10-21T07:46:22Z","snapshot_observed_at":"2026-08-12T22:44:58.038869Z","submitted_at":"2024-09-14T10:49:06Z","title":"Leveraging Self-Supervised Learning for Speaker Diarization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09408","snapshot_observed_at":"2026-08-10T23:05:39.448626Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.448626Z"},"links":{"cited_paper":"/paper/2409.09408","citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:06964db5f851bb63383df526f2365881a4463951d0b597e2f0989c32b0e63105","observation_id":"063e09ba-1294-49ee-a505-1d33ca8b9926","resolution":{"observed_at":"2026-08-10T23:05:39.448626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.692902Z","title":"Kinoshita, M","venue":null,"work_id":"2790b6c3-e6c1-4101-8d3b-1494f65767cf","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.453936Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:f3ce454b509837c1641139efc0b3bfe04552308e0bef55df225b2205545cadc5","observation_id":"75f7608a-70ed-4d9a-a213-99de62902823","resolution":{"observed_at":"2026-08-10T23:05:40.698315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.614976Z","title":"Plaquet, H","venue":null,"work_id":"728277b7-059f-492d-85e2-7e9a1e658685","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.458960Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:13afa6c51a92297ce3def66283fd28d4ca87582f1bd047ca694ba9992c29e2f4","observation_id":"d6dd8d50-ec95-42e0-b165-efc1dbe9a7d1","resolution":{"observed_at":"2026-08-10T23:05:39.620449Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.675451Z","title":null,"venue":null,"work_id":"0871b028-f41a-4d4d-ab2c-aabb24f6e883","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.463750Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:14e09195016fcdb6850b21e92e2bf1c7de3b45801725d4987d1505b3432e0dd3","observation_id":"105ceb0c-d600-4f6c-92d6-d3c703168dd2","resolution":{"observed_at":"2026-08-10T23:05:40.680968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.659305Z","title":"Gulati, J","venue":null,"work_id":"a1b7bc00-87ad-47ed-8766-01b77c7128bc","year":2020},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.468929Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:934e057bd94d49790eee9db98e83d240921a629eabfcf381d5e18fc55335bb1b","observation_id":"287c60f7-9c73-4cb7-90ce-27639fd2dfd3","resolution":{"observed_at":"2026-08-10T23:05:40.664211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.643427Z","title":null,"venue":null,"work_id":"973901ba-a0e4-4fa2-a707-01a25871f84c","year":2019},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.473653Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:d696ea28ed2212b8eb26f97f71d603a1b37b3c0c853cf4a04ce39292a9dac5a6","observation_id":"3396ec68-217e-47ac-a066-ea22f3176993","resolution":{"observed_at":"2026-08-10T23:05:40.648375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2021-102","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.599029Z","title":"Kanda, G","venue":null,"work_id":"fe67e459-88f8-4f70-8620-34150951faeb","year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.478262Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:5c936ba4439e5e0b0279d9218bab2b58c1ee0fa30bbbfc67880eea9c9cd386a6","observation_id":"ae081d3a-e35e-46b2-ac1c-6ef56c6c9f4c","resolution":{"observed_at":"2026-08-10T23:05:39.604033Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.482931Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.482931Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:45bbf32ce4c4f8d9a9c7a8892154c79da219d8f41d26f9cd9c3fc688a3112991","observation_id":"5cb86522-9d0c-4011-bf07-c4abce2430ff","resolution":{"observed_at":"2026-08-10T23:05:39.482931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.487635Z","title":"Fazel-Zarandi, W.-N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.487635Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:a4b873ac11c72d622679d2f62ff610bb5323441d78bc2f8e6bdaec3d6178c5b5","observation_id":"434142d1-ce75-4ae1-a8a2-8ecd4e97c5b7","resolution":{"observed_at":"2026-08-10T23:05:39.487635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-7","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.582826Z","title":null,"venue":null,"work_id":"b2bf7b27-dbe9-4410-9f2d-4565ff618283","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.492311Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:e8afa76822e8705c67f6e8a829b0a56bf65bb3e4c03cc306212dacd3e1b8ce34","observation_id":"2cb3fd5f-7225-4dc1-a699-318ef099bcf6","resolution":{"observed_at":"2026-08-10T23:05:39.588136Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2023-1280","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.566291Z","title":"Zhang, Y","venue":null,"work_id":"7d846011-4fe2-42b5-963f-518164ed70a3","year":2023},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.497246Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:70406346bed47c065e60ed42e8ac97fc22943ba87011538536ad5b6f78a3a814","observation_id":"e34037f9-b5a9-46ee-b6ad-83324d6cde87","resolution":{"observed_at":"2026-08-10T23:05:39.572160Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/chime.2024-4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.548641Z","title":"Polok, D","venue":null,"work_id":"07ba674c-f46e-423d-b752-40e8016c04bd","year":2024},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.502535Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:49cb18e60a88dc9f0d14750a784cccfc747c19c34032567d88988e44158b46c3","observation_id":"fe38cd21-362d-4add-b66b-14ceec7fd3a2","resolution":{"observed_at":"2026-08-10T23:05:39.554991Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.626844Z","title":"Rousseau, P","venue":null,"work_id":"62b6d1fa-8e30-4a3d-82bf-ae4d0683fe58","year":2012},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.507258Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:36d057299f33a513594b0fc61d5201a296738939b16f334c3b90248805c9c450","observation_id":"d9a75cc7-69f4-4784-b173-e625aeb79e8b","resolution":{"observed_at":"2026-08-10T23:05:40.632107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.511964Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.511964Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:8b951b4b47dfe20747c12fd20341b37b3e60786af97972ce3fb0550b72201b8a","observation_id":"b21492c4-3325-4d8f-b264-c535d23ebf8d","resolution":{"observed_at":"2026-08-10T23:05:39.511964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:40.597164Z","title":null,"venue":null,"work_id":"8f634392-9357-4850-b03d-d9a35e0bd1bd","year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.516845Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:138a7ab91fa7145d9d9b31f084ecb5a920222f6f635e875b4803b75a5e2df5fd","observation_id":"2f3357fb-827c-49be-ae62-b639b5c11136","resolution":{"observed_at":"2026-08-10T23:05:40.603020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:05:39.419792Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition","version":1},"reference_index":7336,"source":"pdf_text","source_observed_at":"2026-08-10T23:05:39.419792Z"},"links":{"citing_paper":"/paper/2501.00114"},"observation_digest":"sha256:86492618a42ba03a4398ca1d1bfa16a1d2baac25b2d197c80a8a7734d8cd4840","observation_id":"a42792b0-a462-4c4d-bc6d-365c97910fa6","resolution":{"observed_at":"2026-08-10T23:05:39.419792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.00114","last_updated":"2024-12-30T19:24:15Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T22:57:03.586920Z","submitted_at":"2024-12-30T19:24:15Z","title":"DiCoW: Diarization-Conditioned Whisper for Target Speaker Automatic Speech Recognition"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":12,"verified_fuzzy":15},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 3 inbound Pith citation observations for arXiv:2501.00114."}