{"as_of":"2026-08-10T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31a778f0811e90635ebd59c9a19764b76c38644bf694c0053fdd2b2d0cc78a71","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:31.681017Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:09:27.194061Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:09:31.948054Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.12059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12059","snapshot_observed_at":"2026-08-07T12:09:31.948054Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","venue":"eess.AS","work_id":"f9a9d5f7-04af-409e-bb27-e944d6c0b3f2","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.194061Z"},"links":{"cited_paper":"/paper/2506.12059","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:cfca888cf9312e3425f8587396abffa3495a1178d2b6a54420efaf9a1c87620d","observation_id":"b461f765-2c49-4a8f-8416-d99f9493532f","resolution":{"observed_at":"2026-08-07T12:09:32.043276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12059/citation-record","integrity":"/paper/2506.12059/integrity","json":"/paper/2506.12059/citation-record.json","paper":"/paper/2506.12059"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.901954Z","title":"Existing methods include permutation invariant training [1], heuristic error assignment [2], and serialized output training (SOT) [3]","venue":null,"work_id":"a2001c6d-ed0f-4523-ac8e-a6da7e6d623d","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.096523Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:146ccdffb07edcd137cb230520f0aecda4592c2df0d7f41885a8aee35e98ad79","observation_id":"2f166041-70c8-4788-8014-850c38db052e","resolution":{"observed_at":"2026-08-07T12:09:36.991259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.12059","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.12059","snapshot_observed_at":"2026-08-07T12:09:31.948054Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","venue":"eess.AS","work_id":"f9a9d5f7-04af-409e-bb27-e944d6c0b3f2","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.194061Z"},"links":{"cited_paper":"/paper/2506.12059","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:cfca888cf9312e3425f8587396abffa3495a1178d2b6a54420efaf9a1c87620d","observation_id":"b461f765-2c49-4a8f-8416-d99f9493532f","resolution":{"observed_at":"2026-08-07T12:09:32.043276Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.697050Z","title":"Transcribe speech to text","venue":null,"work_id":"ff78124d-04ac-433e-9315-366c7d7550fe","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.311984Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:275f5bfce14663a43876b50eaf6f463c5e171c4f86b25a68ece865b68cab637a","observation_id":"c7ae2404-c86f-405f-8739-31362014eaa8","resolution":{"observed_at":"2026-08-07T12:09:36.796717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.413182Z","title":null,"venue":null,"work_id":"f3995427-18ab-43de-93f0-ac60755a4435","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.426044Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6fe5572a01870790db50f5c853396ea91c264de81b6a0ad066d0aad456d6ca52","observation_id":"1e54c0ba-37f6-4dcb-9557-2c117dee0b42","resolution":{"observed_at":"2026-08-07T12:09:36.571332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:36.097858Z","title":null,"venue":null,"work_id":"d8200565-97fb-4c8e-b7ed-5c4b1ef243fd","year":null},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.582404Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:aa39fc92462c925b130d6fe7a92cd33cb172fe4bcd6cd9bbe64c671e51fe9b66","observation_id":"c807d938-5570-49a6-a8ff-916adecf83ca","resolution":{"observed_at":"2026-08-07T12:09:36.250615Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.854809Z","title":"Multitalker speech separation with utterance-level permutation invariant training of deep recurrent neural networks,","venue":null,"work_id":"6991472e-9c4b-4b9d-992a-460b2523812d","year":1901},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.739043Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:4616c4234b30ac82063d800dc83c9f9fa7823e4fc7be46d2f02c751f5de920c4","observation_id":"ca569c3a-fed5-442f-b30d-4f958f595b67","resolution":{"observed_at":"2026-08-07T12:09:35.971511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.645310Z","title":"Streaming end-to-end multi-talker speech recognition,","venue":null,"work_id":"c9cf8bb1-bf50-4f8b-8c11-beae4242f200","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.880286Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:f7ecd47ea5102c9d217230515f3180d5afb60a651d069d7e81aee8effae4bb80","observation_id":"61276b1c-657c-4484-b73c-9543a418336e","resolution":{"observed_at":"2026-08-07T12:09:35.713430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.409554Z","title":"Serialized speech infor- mation guidance with overlapped encoding separation for multi- speaker automatic speech recognition,","venue":null,"work_id":"04ddbafb-7018-4882-9a2f-8010b9307239","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:27.996458Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:9257bd59e3593ae4211723c01f40b1baafb386d6f7aeea067d650d2030ba1f5f","observation_id":"f75606b1-65c9-4335-8ba4-14a347eea713","resolution":{"observed_at":"2026-08-07T12:09:35.542048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.202122Z","title":"Enhancing recognition of rare words in ASR through error detection and context-aware error correc- tion,","venue":null,"work_id":"df5a425f-cf8f-43b7-be35-a804bb65997a","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.136386Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:b6d58f73d1ecf6e1f209a5ea9b3f9d59017fc882b551428fb528bbe4266ef999","observation_id":"c9fc9649-8968-43f7-8e7f-1a327b65b689","resolution":{"observed_at":"2026-08-07T12:09:35.278660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:28.271198Z","title":"Deep shallow fusion for RNN-T personalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.271198Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:156fb2dd8958853fffe16d6202490410ae49b8aef7d344ddd1c057d3f1c3456a","observation_id":"2d0e8287-0267-4ee5-9125-e6c945418fca","resolution":{"observed_at":"2026-08-07T12:09:28.271198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:35.036274Z","title":"Graph neural networks for contextual ASR with the tree-constrained pointer generator,","venue":null,"work_id":"173dd514-17ef-4204-8a6f-1c7fcb535830","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.386644Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:5120ecb83570e3f8c1bf522fab494ee255b58d35f5b1953cedaa1ae62f348f16","observation_id":"b0dffb9e-a7f5-4470-9c27-afee65a11ed8","resolution":{"observed_at":"2026-08-07T12:09:35.109104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.729580Z","title":"ED-CEC: Improving rare word recognition using ASR postprocessing based on error detection and context-aware error correction,","venue":null,"work_id":"6ec02aab-68f8-4abd-baf4-255856a84513","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.670237Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:4f167b4846c1077cdaf3da43df302e83e8f2bf1ef91e7a027c563e22da35418f","observation_id":"ec71b4a3-470b-461b-a447-28badc114258","resolution":{"observed_at":"2026-08-07T12:09:34.826738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.561785Z","title":"MF-AED-AEC: Speech emo- tion recognition by leveraging multimodal fusion, ASR error de- tection, and ASR error correction,","venue":null,"work_id":"490a0822-0ce7-44bd-a2a6-c70741e1abf5","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.822009Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:032c5d0cd5e71b6eea579bc9e881a4c3172c8e279a2d28911b6666d9b79a3c78","observation_id":"e66b1950-6ca7-40e5-8891-fd0454c628fb","resolution":{"observed_at":"2026-08-07T12:09:34.676736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.359718Z","title":"PMF-CEC: Phoneme-augmented multimodal fusion for context-aware ASR error correction with error-specific selective decoding,","venue":null,"work_id":"1a82195a-b75b-427b-9db8-1ced4bffe7a4","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:28.952457Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:0729ba1e3f0375db3358dd87a1218b25407bd7d6cade2ef69c1bea8b9200f6d1","observation_id":"2515c3c8-c2f3-4ccc-8f96-fab159f99164","resolution":{"observed_at":"2026-08-07T12:09:34.443019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-07T12:09:29.130086Z","title":"Seed-ASR: Understanding di- verse speech and contexts with LLM-based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.130086Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6ef2ebd10a2f927ea392e4edfbb482e35356fd12bbd877a29bf5570793bb1b99","observation_id":"a1f20979-b550-4282-b092-91f0057acbfd","resolution":{"observed_at":"2026-08-07T12:09:29.130086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T12:09:29.261712Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.261712Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:842e6a88443e70f70a08d9aad0b784cfe3bcf4531c9765e5d5610fe300ac965c","observation_id":"742981cb-d519-4ac6-965e-c5f737cccefb","resolution":{"observed_at":"2026-08-07T12:09:29.261712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.264376Z","title":"Large language model can transcribe speech in multi-talker scenarios with versatile instructions,","venue":null,"work_id":"044d82e1-f04e-4f2c-ba17-34f24c24ed25","year":2025},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.370985Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:be6b604aef566ad0dc964cf968aa60d213758440fed28eba475f922d520e8037","observation_id":"0ca27cd7-abd9-47e4-a07e-69644ea67af7","resolution":{"observed_at":"2026-08-07T12:09:34.300344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.042417Z","title":"Advancing multi-talker ASR performance with large language models,","venue":null,"work_id":"9a6a2be4-22d9-41da-8119-06bffc94edf2","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.473099Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:35824347867ae2753fb605f83af0e26da7f01110f06891bb6734bce2a9e5fdf9","observation_id":"3ac6585b-72d9-48c4-98f5-6855240ee6e9","resolution":{"observed_at":"2026-08-07T12:09:34.143208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.894258Z","title":"Mala- ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":"7b271f6c-017f-4a2a-bb76-2622d071a22e","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.613364Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:bf0cdf7d12e863435a6a52a05d9c1f713859b9ce305315e02f1ccb2ac00fe414","observation_id":"5e973967-77ff-41fb-912b-193968c8f823","resolution":{"observed_at":"2026-08-07T12:09:33.950566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:29.705109Z","title":"Seri- alized output training for end-to-end overlapped speech recogni- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.705109Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:b0c0d1aafbd556193bcc185f0197bc1ca9a8b5d150fe9e313981fd04c416aebb","observation_id":"40f0caa1-7973-473a-ab2a-3615434154bc","resolution":{"observed_at":"2026-08-07T12:09:29.705109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.763337Z","title":"WavLLM: Towards ro- bust and adaptive speech large language model,","venue":null,"work_id":"2a9ddba0-3cad-4427-be0f-6d6ee1b2a8c8","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.812879Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:15faae42c75b4a403db31d3d36e54628ab1132245e3d11e2e729adf63d1b0ebe","observation_id":"937de7f4-5dc5-4a00-8271-8539a28c7050","resolution":{"observed_at":"2026-08-07T12:09:33.822269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.649970Z","title":"Two stage contextual word filtering for context bias in unified stream- ing and non-streaming transducer,","venue":null,"work_id":"b4c0ecd9-abf7-4f01-a9c3-52177e18dc62","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:29.949414Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6c30c11fef9b1dc524d97ac06626c170f3a660eec8bc5fdb9d06228ea63420e8","observation_id":"01f6460a-ca94-466a-bb68-6d402333d7e2","resolution":{"observed_at":"2026-08-07T12:09:33.704550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:34.881667Z","title":"Contextualized end-to-end speech recognition with contextual phrase prediction network,","venue":null,"work_id":"f04a8e90-9ceb-4edb-b197-535c8048d874","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.070448Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6a2d1321b60b3d76ba7413de7ea4cf39d90372a8d7df0f7864badd3e1b1b8369","observation_id":"fda5c2b6-fee4-466c-a53e-d8c6cf3e0343","resolution":{"observed_at":"2026-08-07T12:09:34.966539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.481079Z","title":"Adaptive contextual biasing for transducer based streaming speech recognition,","venue":null,"work_id":"daf0588a-f259-4e89-b8d9-9ada040b29fe","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.132555Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:749a97827df6ef0c91e5ff518f11fc14fb3b74ebfa9e25516f06e5c66bd15021","observation_id":"2586af90-b68e-412d-b6ce-1a4e13a23403","resolution":{"observed_at":"2026-08-07T12:09:33.549118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.329687Z","title":"CTC-assisted LLM-based contextual ASR,","venue":null,"work_id":"787b71fe-8b52-46ea-9ab9-09fc7f43c062","year":2024},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.230634Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:dcf978017e471303183e7457fa06dbc24c6b7b9786b9323e71b41e98406e69e0","observation_id":"62dea830-2b92-425c-8925-793a371dc7b9","resolution":{"observed_at":"2026-08-07T12:09:33.394411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:30.324763Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.324763Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:63dd2b29a58e8a112d104a3acd5128ce8e4b152df8a33880e57266b43cd65219","observation_id":"b6313a98-478d-4d11-9d1b-2ac9a3689ad8","resolution":{"observed_at":"2026-08-07T12:09:30.324763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.161918Z","title":"Vicuna: An open- source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"7ff8a43b-c94e-4e27-b2d0-acbbf8d1c030","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.425177Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:eeb8e0a4ef45025d42e1944fec9ecc6b98c4fe638cafb6a517aa8444c0202ff6","observation_id":"0ba2566a-cde5-4b61-8f0e-e169c6c43470","resolution":{"observed_at":"2026-08-07T12:09:33.227424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:09:30.543058Z","title":"LLaMa: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.543058Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:6e55b4879391f304e9222d81ccee9441b017851470193224b0e4ccd5b0f4803f","observation_id":"f595921b-1348-44e9-b8f7-90e00f82821e","resolution":{"observed_at":"2026-08-07T12:09:30.543058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:09:30.661940Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.661940Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:fe4108976fe25f091a4ec28cb3235f79a77040160b79d616322079220f1ebe60","observation_id":"1c32bd28-7c18-471f-95a0-0c0fba849fb7","resolution":{"observed_at":"2026-08-07T12:09:30.661940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:33.029604Z","title":"Multi-speaker ASR combining non-autoregressive conformer CTC and conditional speaker chain,","venue":null,"work_id":"669b1ae3-3d04-434c-b325-d020b0177c55","year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.745173Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:8cedea7d6d8d765ef4f940960691f418a3205ad121cae954824bd1797774e5d7","observation_id":"c9e4d756-8332-4fb5-a2e6-f07c472be072","resolution":{"observed_at":"2026-08-07T12:09:33.080521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.899554Z","title":"SURT 2.0: Advances in transducer-based multi-talker speech recognition,","venue":null,"work_id":"0f7a06cc-184f-45c8-afd9-bbe772795ecf","year":2023},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:30.910459Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:995eaa1fe86b8a691d10ec43cc938a3d6f87b1ec46a5dd99fbd422299122ebc2","observation_id":"b655d788-8d15-4223-9a56-faca7f3cf113","resolution":{"observed_at":"2026-08-07T12:09:32.956297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-07T12:09:31.011992Z","title":"Librimix: An open-source dataset for generalizable speech separation,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.011992Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:91a3abeef37f1f4841653c814b1ea41d0645410323badf9fe1149214aba23757","observation_id":"c9f657fd-e3a5-423d-b32a-b959443a57b8","resolution":{"observed_at":"2026-08-07T12:09:31.011992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.735649Z","title":"The AMI meeting corpus: A pre-announcement,","venue":null,"work_id":"9e9b2257-979d-44b7-b5b6-3897a8a4969f","year":2005},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.125217Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:97555f2a433ea02c6fbe76c8512d563937e11abe69a13b104dcbe5e8bdd7c6f5","observation_id":"eac9a3aa-e557-4698-acc1-eb4626949113","resolution":{"observed_at":"2026-08-07T12:09:32.829565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.585697Z","title":"Lib- rispeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"521a3b70-47bc-4c3d-85f4-f020844281d5","year":2015},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.230722Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:aee27a2cd65477a3d880caadeb62777be97639d36228505bd8388e8c3cec4355","observation_id":"3a94d443-1457-4b92-a0de-8187da9f7fbb","resolution":{"observed_at":"2026-08-07T12:09:32.651434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.455296Z","title":"Wham!: Extending speech separation to noisy environments,","venue":null,"work_id":"e7af00aa-cc2d-4793-8cc9-4ab51e7cf202","year":2019},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.358142Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:1a30f7716fc871a770ceede654130c9c4fe333b6102731eff06bc1d4347cf70d","observation_id":"99f2038c-8547-442a-aa41-55d50fc30471","resolution":{"observed_at":"2026-08-07T12:09:32.515155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.325318Z","title":"Acoustic beamform- ing for speaker diarization of meetings,","venue":null,"work_id":"25b07ff1-c8b5-4ab2-9db4-761c202e7e44","year":2011},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.477173Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:25576a45796d8a8f87a994555d5afe3d98deb5ab739d76b82cf88efc21199972","observation_id":"ddf434f9-8855-43b3-abf6-a52f9b21ab96","resolution":{"observed_at":"2026-08-07T12:09:32.378574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.02194","last_updated":"2021-06-11T23:10:43Z","snapshot_observed_at":"2026-07-06T10:56:42.387460Z","submitted_at":"2021-04-05T23:59:43Z","title":"Contextualized Streaming End-to-End Speech Recognition with Trie-Based Deep Biasing and Shallow Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.02194","snapshot_observed_at":"2026-08-07T12:09:31.575701Z","title":"Contextual- ized streaming end-to-end speech recognition with trie-based deep biasing and shallow fusion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.575701Z"},"links":{"cited_paper":"/paper/2104.02194","citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:3c3b8073316eed1a928313a6ee015fe66ca15a824d1eddc7087f4e225d08e56f","observation_id":"535de2c2-7f28-4551-9321-9a34cc7d17f2","resolution":{"observed_at":"2026-08-07T12:09:31.575701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:32.151982Z","title":"Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition,","venue":null,"work_id":"4b8fda03-8cf1-466f-9a87-4c5954fd0c1f","year":2022},"citing_paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:31.681017Z"},"links":{"citing_paper":"/paper/2506.12059"},"observation_digest":"sha256:f0043165fb545cc14545a269b589d1b05bb150562f22391fa94b821dd09e69cb","observation_id":"6df68e98-6b42-4f22-a91e-d6ca83afadfe","resolution":{"observed_at":"2026-08-07T12:09:32.253993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12059","last_updated":"2025-05-31T07:26:44Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-10T04:52:09.969941Z","submitted_at":"2025-05-31T07:26:44Z","title":"CMT-LLM: Contextual Multi-Talker ASR Utilizing Large Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 1 inbound Pith citation observation for arXiv:2506.12059."}