Pith. sign in

Paper Citation Record · LEDGER

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 4 inbound Pith citation observations for arXiv:2506.05796.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.05796 v1

Coverage vector

measured 40 of 40 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T10:18:52.399445Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T17:58:01.482455Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T07:57:44.681677Z

Reference resolution

40 of 40 outbound references displayed

  • verified exact0
  • verified fuzzy25
  • unresolved15
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ddc2f27e-3a79-40e5-93ee-b2219d301ab9 · outbound

This paper cites Conformer: Convolution- augmented transformer for speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Conformer: Convolution- augmented transformer for speech recognition,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:46.284510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:46.284510Z digest=sha256:98f2f80d5c68dad0f14066347b3659878476557f6ea618be57d94c5582893ab0

Observation 125cf6a5-a89a-406e-b5ec-1b49d37b145a · outbound

This paper cites Recent advances in end-to-end automatic speech recog- nition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Recent advances in end-to-end automatic speech recog- nition,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:19:00.755249Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:46.436866Z digest=sha256:7074ad3abd5da1f58871a3ba24959ea37a0abbd617c9a80516e361161efac2bb

Observation 96fd517d-f861-4492-a9aa-5214cec1df15 · outbound

This paper cites Zipformer: A faster and better encoder for automatic speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Zipformer: A faster and better encoder for automatic speech recognition,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:46.610670Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:46.610670Z digest=sha256:93ffcf26435c0c73b1d9d9fd9cf12c3f8ad1e020382b08a5cef1a55cbc38cf2f

Observation 6a6e33d5-330d-49d2-8c46-e186c547be93 · outbound

This paper cites Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Survey of End-to-End Multi-Speaker Automatic Speech Recognition for Monaural Audio

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:46.748745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:46.748745Z digest=sha256:98faa0c7a4c003c12394a77b6c1ffdec359ff64d89287c55fc65cf0f7753afe0

Observation e719cc1b-7012-42c1-a3f9-2aa26fcf4324 · outbound

This paper cites The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models The CHiME-7 DASR Challenge: Distant Meeting Transcription with Multiple Devices in Diverse Scenarios

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:46.930479Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:46.930479Z digest=sha256:0240f4dbdeef06689153f34a6bcdcd9aa0e7f73a8a9442b1240da744e7cad4f7

Observation fce4c73c-2739-4fc4-9714-7aa4dd7007d3 · outbound

This paper cites The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models The CHiME-7 Challenge: System Description and Performance of NeMo Team's DASR System

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:47.093900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:47.093900Z digest=sha256:f1bdc4b80b8bfa813e0c9c82f3d331fe3999469f623aa3d438803ee24a38de30

Observation ae635742-d518-43ee-a32b-485d18629f94 · outbound

This paper cites The iacas- thinkit system for chime-7 challenge,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models The iacas- thinkit system for chime-7 challenge,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:19:00.491328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:47.212304Z digest=sha256:d470593f57d201a9a0f55bcbc3ac6c148ff8b84d0d50925908d4e4bdffe16811

Observation 40a396bd-63a8-44c3-a9f7-24276a5de59f · outbound

This paper cites Lexical speaker error correction: Leveraging language models for speaker diarization error correction,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Lexical speaker error correction: Leveraging language models for speaker diarization error correction,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:19:00.174579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:47.378249Z digest=sha256:358e73f6f51e552d5f9723ce9ad7e32c7b66674d17ef40d4ed523c68b05accb7

Observation a30ada74-12b3-4e78-b54d-cb3ec0539a55 · outbound

This paper cites Diariza- tionlm: Speaker diarization post-processing with large language models,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Diariza- tionlm: Speaker diarization post-processing with large language models,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:59.813755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:47.577559Z digest=sha256:195bbe3ae9444344cd2e8f01c92a493715bb3195663b96dbc0cfe2c275c717bf

Observation 3d8c46d5-8615-439a-8c07-efb2f3278b04 · outbound

This paper cites Continuous speech separation with conformer,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Continuous speech separation with conformer,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:59.351172Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:47.692208Z digest=sha256:98b32c958e0264204249b32a7e803bc81cfdf06c83a77e3e290555345fb42f73

Observation ead1c679-59bd-4bb8-8119-4c1a3580cbc7 · outbound

This paper cites Low latency online blind source separation based on joint optimization with blind dereverberation,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Low latency online blind source separation based on joint optimization with blind dereverberation,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:59.137794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:47.874830Z digest=sha256:a9cab7286450f9dd1d07f75c8664b5bba52f22c01bc8aa0976ab9864752f4ab8

Observation 2268b755-ca0c-49f0-af65-18373f325de5 · outbound

This paper cites Gpu-accelerated guided source separation for meeting transcription,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Gpu-accelerated guided source separation for meeting transcription,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:58.864495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:48.008644Z digest=sha256:c2d56981ec56dd592b678551a687152f4ef3c7811d584f39fbd5690a7e7860d0

Observation 123df304-22b8-42da-b864-e69730549b57 · outbound

This paper cites Recognizing multi-talker speech with permutation invariant training,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Recognizing multi-talker speech with permutation invariant training,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:58.570712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:48.186953Z digest=sha256:91acd1c962ce9a2bc084eb0620138cb37b1386811e1c61994a34de482f03a28a

Observation 33aff08b-c8ff-4a63-9447-ba9428149f9c · outbound

This paper cites Mimo- speech: End-to-end multi-channel multi-speaker speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Mimo- speech: End-to-end multi-channel multi-speaker speech recognition,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:58.298479Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:48.367081Z digest=sha256:4309164359c135c0bca877a703be2dda12bebe35573d85722aa41f43b89b5b36

Observation 5b8a5bc0-0652-4e9d-a55f-546a11dd33ae · outbound

This paper cites Improving end-to- end single-channel multi-talker speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Improving end-to- end single-channel multi-talker speech recognition,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:57.994425Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:48.523338Z digest=sha256:a52837ea909c181400ad73ba83bd5083d3aff995a9bc6fdb2590b64a0c325b6f

Observation 1b2c1675-0cb5-4a41-a4ab-9378605ff336 · outbound

This paper cites Serialized output training for end-to-end overlapped speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Serialized output training for end-to-end overlapped speech recognition,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:48.656650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:48.656650Z digest=sha256:23b29f73b8ab6c312f75b8548066f2d6ac3a3e00d0438f6c4fd7bef6e9ae09d7

Observation 37f24056-4cef-4f4e-872a-5d2bd2541fdc · outbound

This paper cites End-to-end speaker-attributed asr with transformer,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models End-to-end speaker-attributed asr with transformer,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:57.636294Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:48.816512Z digest=sha256:4a1014bd659af63c0aae9728b5566d619c192de98e886e4b5bb3f652996517f8

Observation e4bc38a4-514c-4e0f-aaf7-ceef925de09b · outbound

This paper cites Streaming speaker-attributed asr with token-level speaker embeddings,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Streaming speaker-attributed asr with token-level speaker embeddings,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:49.072312Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:49.072312Z digest=sha256:ba96a04a20e5e26ec3440cfb8585e9bd68f384018103172b2b7292dbaed636e8

Observation 56024215-7799-4f6b-90ac-6042bd091f54 · outbound

This paper cites Auxiliary interference speaker loss for target-speaker speech recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Auxiliary interference speaker loss for target-speaker speech recognition,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:56.992755Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:49.251676Z digest=sha256:90c5ba7caad464adca50cd67d0e79ae8ceceaae09c148164502aa960a2ec30cc

Observation bc9da3ab-26d4-42e7-ac47-7c8d4fdefe5b · outbound

This paper cites Conformer- based target-speaker automatic speech recognition for single-channel audio,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Conformer- based target-speaker automatic speech recognition for single-channel audio,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:56.514038Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:49.430150Z digest=sha256:424bba1c978a33976aed871c62e8fe54b3e77307076ea82456f6c38f3db512cf

Observation 346aead5-8527-4efc-89f1-c9f22ae35a6f · outbound

This paper cites Extending whisper with prompt tuning to target-speaker asr,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Extending whisper with prompt tuning to target-speaker asr,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:56.210009Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:49.568686Z digest=sha256:1f0a225d3e3822c37306dabe0608600c137a84f8cc492077623b6639722905a1

Observation 37920476-61a9-4a53-8e8a-34c95af5e9fe · outbound

This paper cites Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Adapting self- supervised models to multi-talker speech recognition using speaker embeddings,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:55.796727Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:49.734536Z digest=sha256:9e79696006b1451ab84f06b6cf6abb94b36c0426b07b96536286cedd1782a15d

Observation ae636b1d-81ce-4ba8-9748-e27cddc8117c · outbound

This paper cites Empowering whisper as a joint multi-talker and target-talker speech recognition system,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Empowering whisper as a joint multi-talker and target-talker speech recognition system,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:55.423927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:49.846478Z digest=sha256:f35a27cb8b2c4a0607568ba732e630332706224e505c1cae5679ec38f7ea48cd

Observation ffeb8292-4373-48ef-8acd-da3da4e2bbbf · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models LLaMA: Open and Efficient Foundation Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:49.976744Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:49.976744Z digest=sha256:765867a1eaef6dd98c5fd71d9a81ffc54d0cf294823308fe43b0c223128844c8

Observation b2b1d17f-ddac-4d28-bf84-58aabff639e3 · outbound

This paper cites DeepSeek-V3 Technical Report.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models DeepSeek-V3 Technical Report

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:50.077448Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:50.077448Z digest=sha256:311d1695d135e96ea926fa3c662d428cdb97e74e548fd3acee4e22379a5a8474

Observation 000cff5f-cd19-42f7-8d6d-f3c63d10dc20 · outbound

This paper cites Qwen3 Technical Report.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Qwen3 Technical Report

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:50.210221Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:50.210221Z digest=sha256:c0640833ef6dde804cbd1ac1d8a9816f4e09cbe66ebaf445880ba2dec5b8b889

Observation 2180efab-0a2e-4738-bbb0-371c3ac4193a · outbound

This paper cites M2met: The icassp 2022 multi-channel multi- party meeting transcription challenge,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models M2met: The icassp 2022 multi-channel multi- party meeting transcription challenge,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:55.088131Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:50.365313Z digest=sha256:cf8eb64d27a1bc91b5e32698d11b3b2232898027e24fd228925ac9b11f549711

Observation 66011fc7-a22c-4882-8c55-ed4d9be4af44 · outbound

This paper cites Meeteval: A toolkit for computation of word error rates for meeting transcription systems,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Meeteval: A toolkit for computation of word error rates for meeting transcription systems,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:54.622571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:50.502377Z digest=sha256:219d661ff2ac51378870bf67d4835e347e4fdbcd8c5f16932ca0f971a1c282c6

Observation 801486c9-2bc7-4312-845a-bd11e17f897f · outbound

This paper cites Common Voice: A Massively-Multilingual Speech Corpus.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Common Voice: A Massively-Multilingual Speech Corpus

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:50.628216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:50.628216Z digest=sha256:e701959ad1e5dd533508a9e5bb6568f016c54eb47eb75c79a68d7f6649d35f76

Observation 0a90cc38-0f02-40b5-a2ad-e24e58716043 · outbound

This paper cites V oxblink: A large scale speaker verification dataset on camera,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models V oxblink: A large scale speaker verification dataset on camera,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:54.262814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:50.823454Z digest=sha256:cced81203bf299fbf52424c988c86ad8d6116a43450261a4416f58032c842170

Observation 4f78afb0-9a03-4102-90f9-cb1a70816c95 · outbound

This paper cites V oxblink2: A 100k+ speaker recognition corpus and the open-set speaker-identification benchmark,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models V oxblink2: A 100k+ speaker recognition corpus and the open-set speaker-identification benchmark,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:54.023729Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:50.988675Z digest=sha256:655f8d7348a36bbc24c57108278ab48f613a70b9e1d4c094c0ba642d2d64079d

Observation 39b93780-8255-491f-887c-3ac98585d8e6 · outbound

This paper cites Robust speech recognition via large-scale weak super- vision,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Robust speech recognition via large-scale weak super- vision,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:53.743113Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:51.147336Z digest=sha256:f8999e9ac7b3d2f9273765cd4196c66e53d80187d610cce52962f4154ad68add

Observation 3d33cebb-b5fd-47d7-b599-9828410d05be · outbound

This paper cites Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Sequence-to-Sequence Neural Diarization with Automatic Speaker Detection and Representation

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:51.269948Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:51.269948Z digest=sha256:dab8e2bc92745760a9712e61ca40f12afa268c0e576ea69880300f5f3a08d41e

Observation fab60a21-d8ef-452b-b852-a9fe986cd6d9 · outbound

This paper cites Target-speaker voice activity detection via sequence-to-sequence prediction,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Target-speaker voice activity detection via sequence-to-sequence prediction,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:53.357300Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:51.461795Z digest=sha256:d592947cca64c10be8b049f8247a02c03e289d89c7a184ace6da2d335ef50c8e

Observation 5c368eea-06b5-4ebd-aadf-26aaea5af809 · outbound

This paper cites Qwen2.5: A party of foundation models,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Qwen2.5: A party of foundation models,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:51.655153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:51.655153Z digest=sha256:291c6f306d072879304cc809f81c1faa55a5a6b8e77dae9dea292d5e7e264243

Observation 0db2632f-140a-4448-afce-d095e8da946f · outbound

This paper cites Deep residual learning for image recognition,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Deep residual learning for image recognition,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:51.770378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:51.770378Z digest=sha256:c6b33e0e1e5e215cb94891609e4627d73c9b6f4b9e6767e46defe02e4be6d8b6

Observation 314f9479-bc79-4f09-bcb5-5fa240649b68 · outbound

This paper cites OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models OSUM: Advancing Open Speech Understanding Models with Limited Resources in Academia

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T10:18:51.939607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:18:51.939607Z digest=sha256:33b724bdd02b24b90468fa58e4dc3d0c2d0078479e742eb502e9414e6e2702e0

Observation 1fa9ea15-77d6-4f3a-b8c1-78ddd7c64b54 · outbound

This paper cites A comparative study on speaker-attributed automatic speech recognition in multi-party meet- ings,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models A comparative study on speaker-attributed automatic speech recognition in multi-party meet- ings,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:53.069598Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:52.106493Z digest=sha256:2c0086901189f101102ff92c07f19a27917b9dfe819e9b99deb0244006380e7d

Observation 5bc6a903-a3ec-4597-a90a-9d67dfb09248 · outbound

This paper cites Casa-asr: Context-aware speaker-attributed asr,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Casa-asr: Context-aware speaker-attributed asr,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:57.286697Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:52.254423Z digest=sha256:2b74ac4e0464666f1c0276457e5f670ec9004a8f9acd0cd33885003359963b48

Observation e16a9a69-f74d-4592-a6eb-d97a60d0239d · outbound

This paper cites Sa-paraformer: Non-autoregressive end-to-end speaker-attributed asr,.

Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models Sa-paraformer: Non-autoregressive end-to-end speaker-attributed asr,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T10:18:52.750199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-07T10:18:52.399445Z digest=sha256:6c232a3ea7b4cc41a1f039358bbf18b3ea5fb517b8208fe3a006b0e4c23f8c03

Pith citing papers

Observation 3f3f5baf-da44-4948-8150-38964a23088a · inbound

The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge cites this paper.

The DKU System for Multi-Speaker Automatic Speech Recognition in MLC-SLM Challenge Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T17:58:01.482455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T17:58:01.482455Z digest=sha256:179e0e75248eb3f892bace3deedd218e77f8073a971208fb37a630b513656032

Observation 4674cee3-c33d-4994-8c22-d0b1951e15b1 · inbound

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding cites this paper.

TagSpeech: End-to-End Multi-Speaker ASR and Diarization with Fine-Grained Temporal Grounding Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-03T11:20:26.130555Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T11:20:26.130555Z digest=sha256:a687e85b89c53c3de7d195d8ee3171d95ba76346997d96e8646f93ca5e993131

Observation 7979bb9f-f26c-4b78-8e4e-1a2604944a82 · inbound

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models cites this paper.

DM-ASR: Diarization-aware Multi-speaker ASR with Large Language Models Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 33

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:21:12.609984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-05-08T09:18:53.285951Z digest=sha256:7623e0022bd1dd556c9773a0f35290a788cb48da39c210a387469e124aa33960

Observation 491b754c-fb6f-4348-9336-9153c19c506a · inbound

Speech Encoder Fusion for LLM-based Automatic Speech Recognition cites this paper.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:57:44.683338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:b867ebcbec7d522828f5a7d2d20822d84d757e9f6c0933cc1118cc4ec84f26f3