Pith. sign in

Paper Citation Record · LEDGER

Speech Encoder Fusion for LLM-based Automatic Speech Recognition

As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2606.10853.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.10853 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-27T11:32:58.335783Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-12T06:34:41.77262+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T11:32:58.335783Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-03T07:57:44.678976Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact4
  • verified fuzzy0
  • unresolved39
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 60fed204-647c-4b3c-9f12-58151d5d53f8 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:090391efc110e5ab2cce164cb19e1cf4a491db6b33964a5e839267c40118aa1c

Observation f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f · outbound

This paper cites Speech Encoder Fusion for LLM-based Automatic Speech Recognition.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech Encoder Fusion for LLM-based Automatic Speech Recognition

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.680345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:ddb30ed4d0e3394b2fc2b4c53611fa25a84ccfb3a596fd314098fd8e12f7ae4a

Observation 010a30db-6313-4ea5-9202-5a6d35e625d6 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:c872f192c144dd32dadf729d527ff6ebfe549325ca8394e280d6d08005a5f826

Observation 89867cb9-6195-48ab-9ba3-1f4894f17068 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:caf9763b7ad87b987f32faa6419d797b3f900f6ba54d86fcd9a158be1aa9dce5

Observation 35356ebf-7ce3-40e3-b0e7-3e86e9e3077e · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:f89ac3f7db7809c08c4bd55d1d3d6c5d85f97b47205594022a3eb590a2faf7b8

Observation cb5908c9-155e-46a0-b3a7-775e4b9a98b1 · outbound

This paper cites 0: Hello. 1: How are you? 0: I’m fine.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition 0: Hello. 1: How are you? 0: I’m fine

Reference 6

Resolution
malformed identifier
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:fa3a7c6025043221f221dcaaa06c107a0d158a85b682402a9ae3cc3a88688f4a

Observation 7ada9d18-f7dc-4a05-b059-d6ee9e61bb5c · outbound

This paper cites Although speech-LLMs have difficulties at- taining performance of dedicated ASR systems, augmenting LLMs with speech capabilities has much wider applications be- sides ASR.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Although speech-LLMs have difficulties at- taining performance of dedicated ASR systems, augmenting LLMs with speech capabilities has much wider applications be- sides ASR

Reference 7

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:62149a3090e720dc0977826e812c68768e530488487a7446b4a611b8a2144857

Observation 8a87ba39-287d-41aa-8460-838167b111fa · outbound

This paper cites We found that careful fusion outperforms standard feature concatenation in all cases.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition We found that careful fusion outperforms standard feature concatenation in all cases

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:5217d632b429fe1ea7c2e278ed1acafb1c1484bec0dda6af58dc995a5ae24a6f

Observation b477bcbc-5e85-4293-bb4c-730f1b97f521 · outbound

This paper cites an unresolved cited work.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:aceab09331ee4b63cc767eac4f2f9eb3bd96f7f110434c5fb2b3c1bb08d1ec5b

Observation 6049178e-9f83-4431-92f0-7f21f52becfd · outbound

This paper cites No part of the manuscript’s content or ideas was produced by generative AI.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition No part of the manuscript’s content or ideas was produced by generative AI

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:a71278d30c320ab39da66da07930dbd69a992a29aaa13dde1a90f3ea6f111e4f

Observation 487ef033-f0e3-49fc-b85c-7f06de76871a · outbound

This paper cites BLIP-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition BLIP-2: Bootstrap- ping language-image pre-training with frozen image encoders and large language models,

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:0cfe9fd86a339254951c38fb0427df73b4a515b58ed617e8f21fc7086d104a1f

Observation 2bb29882-95e5-4591-8d44-620d6e41f88a · outbound

This paper cites Visual instruction tuning,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Visual instruction tuning,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:c18c59a3b052fc86bf7ea347210794ad9c1f1e79027ea140847d5ca2f761d933

Observation e4925622-4525-4f07-9bf9-2d1dc972c69e · outbound

This paper cites Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.685719Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:df31c3a49c92b22d90172d9ce642da2fbe0037d7df9982c9e41d474df6b4ead9

Observation 9603f22e-0b20-4bfc-9826-3f197c8a8bef · outbound

This paper cites SALMONN: Towards generic hearing abilities for large language models,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition SALMONN: Towards generic hearing abilities for large language models,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:7bf93e61ea38f21635eb1c0d1acb55fe674ef30ee871509722933b7bbda7ab05

Observation 9e103e6f-5f4c-4c24-b3fe-00e35ea8fb3b · outbound

This paper cites AudioChatLlama: Towards general-purpose speech abilities for LLMs,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition AudioChatLlama: Towards general-purpose speech abilities for LLMs,

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:cc52e947c0c768777131f1dc00cc3c3c09277de910a456e4f62962f930ed0e38

Observation fdd62753-c608-423c-990c-2ba71b132fac · outbound

This paper cites Speech ReaLLM – real-time speech recognition with multimodal lan- guage models by teaching the flow of time,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech ReaLLM – real-time speech recognition with multimodal lan- guage models by teaching the flow of time,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:a0d18250a1e45c1221eb53de4361bf77401ebe3c178597fb4680000e55f260bf

Observation 318b608d-a294-4525-984e-d6a297799777 · outbound

This paper cites Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Wav2Prompt: End-to-end speech prompt learning and task-based fine-tuning for text-based LLMs,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:4b7a621160d14ddb2fea6547fa1811c135ace693d8c31cb25a474dc002e2b4e0

Observation ff5e17ce-a7c4-4af2-92ab-3524031ea049 · outbound

This paper cites BESTOW: Efficient and streamable speech language model with the best of two worlds in GPT and T5,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition BESTOW: Efficient and streamable speech language model with the best of two worlds in GPT and T5,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:197da45d783cb0edd9b92141e2b79058cc386373986862dd31f907f7c9efb5b6

Observation 46b05289-1338-4f5b-b589-5d650f88aafe · outbound

This paper cites Speech recognition meets large language model: benchmarking, models, and exploration,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech recognition meets large language model: benchmarking, models, and exploration,

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:466c12fbe4213969acf7e4b1ef0b4a5fad4e5c2ef170e038cb5cacfe6bb43b7b

Observation 5bfff35c-5238-401a-8381-ced8bbedb4c5 · outbound

This paper cites Connecting speech encoder and large language model for ASR,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Connecting speech encoder and large language model for ASR,

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:d79a2fc1444d513b5fe53490b382516464abde9d49c694a4a0157c778c05c83e

Observation 0f4fbd24-82ab-41d3-a5b8-df67363b844d · outbound

This paper cites How to connect speech foundation models and large language models? What matters and what does not,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition How to connect speech foundation models and large language models? What matters and what does not,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:dccfa7d876a50de9483ed75d9c0ba3ef72224de90a172dbaa1b5579107edebe2

Observation fab720ae-6a5c-40a0-adbc-f91b6e861fc4 · outbound

This paper cites Prompting large language models with speech recog- nition abilities,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Prompting large language models with speech recog- nition abilities,

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:4d524126c222ee41e1ab6e34a26e0e2474aaa6692d849aabb884b49433669a29

Observation 50653965-3851-4867-a341-582a0d4625e0 · outbound

This paper cites Robust speech recognition via large-scale weak su- pervision,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Robust speech recognition via large-scale weak su- pervision,

Reference 23

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:d41e93a0ceeeecf900212415376f0645329ab710afecdabc2dfe4bf292067f27

Observation 7b0887a6-ae9c-43fa-910f-679b66637a3c · outbound

This paper cites OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:eb08044d6db6a45b1a5d8b318b141ccc76cfa37a0394442cb5e72604bc34de21

Observation 1c8523ea-90b5-4524-af70-4043a0286dc0 · outbound

This paper cites wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,

Reference 25

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:9b9af83d7888f9640428c2a44ea7f9384f6f3d76ab6ef11b70dff81e5144a0da

Observation 0698eaf9-bb2a-4352-bfd4-1d80d95273f2 · outbound

This paper cites WavLM: Large-scale self-supervised pre-training for full stack speech processing,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition WavLM: Large-scale self-supervised pre-training for full stack speech processing,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:92dc1f70bdc2ac6c53fe6122c15e6c59237ed5a20e26f16d6cc240b3b8d4cb76

Observation 82620119-0285-45c0-819e-13e01dbf8397 · outbound

This paper cites Better pseudo- labeling with multi-ASR fusion and error correction by speech- LLM,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Better pseudo- labeling with multi-ASR fusion and error correction by speech- LLM,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:430d13e24b520ae670825bc8eeeabc32ca4a17a384259d60ebc46860d52e8347

Observation 962645b5-c3a8-4b21-8318-6fe2577589a6 · outbound

This paper cites Attention is all you need,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Attention is all you need,

Reference 28

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:975ce2c6d7b512a3f537c6c61149780a443035026a39a3bee17bd81f9b8c4ea0

Observation d6009c95-e63b-4404-a6a4-4bfbfe68c066 · outbound

This paper cites Leveraging broadcast media sub- title transcripts for automatic speech recognition and subtitling,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Leveraging broadcast media sub- title transcripts for automatic speech recognition and subtitling,

Reference 29

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:84c4419a40e83a9d454f6fdeb6943130f34d78e5c05b7a440bb4bd11c9b196af

Observation 51d583c8-c661-4845-81b7-2939c33c77aa · outbound

This paper cites WavLLM: Towards robust and adaptive speech large language model,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition WavLLM: Towards robust and adaptive speech large language model,

Reference 30

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:62c5c345b13e72e8d1b9e541f5c3f553e959e56f8ffa62cfbcdaa42beddd21f3

Observation 491b754c-fb6f-4348-9336-9153c19c506a · outbound

This paper cites Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Diarization-Aware Multi-Speaker Automatic Speech Recognition via Large Language Models

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:57:44.683338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:1b73e6a6a9dd2da00fd1cc2d012551ad5818192b24ebbe20ea3c68abc9abba6c

Observation 802cb44b-d06e-405c-84fa-d60e55921e2b · outbound

This paper cites MoWE-Audio: Multitask audioLLMs with mixture of weak encoders,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition MoWE-Audio: Multitask audioLLMs with mixture of weak encoders,

Reference 32

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:8c04832fd83db5e40c6dfd9bd24fe5a116985d1b9149362504e44520f59d3d28

Observation 43987fa7-989d-40d4-a183-53a5ca314ad3 · outbound

This paper cites Enhancing speech large language models with prompt-aware mixture of audio encoders,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Enhancing speech large language models with prompt-aware mixture of audio encoders,

Reference 33

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:d923d389eda75fcd44d2008e97c577e02142a66f12bdf7a607c6b6c56fc0b4d8

Observation 6a2344da-645b-48b6-9468-16787507174e · outbound

This paper cites Hybrid CTC/Attention architecture for end-to-end speech recog- nition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Hybrid CTC/Attention architecture for end-to-end speech recog- nition,

Reference 34

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:2f9266e891e744f9880b72e3ad47381540752fec810fac7c880d9b8e32445e40

Observation 9693f9bd-1ffd-4fcf-8157-511f9c630a2c · outbound

This paper cites Learning to jointly transcribe and subtitle for end-to-end spontaneous speech recognition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Learning to jointly transcribe and subtitle for end-to-end spontaneous speech recognition,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:d17cca198a0eba5d496d79834f58fdf698cad88c501bb5fbe62d43c7fd7baa30

Observation 3e4501f9-0825-450a-a54e-3f2ef6acbc6f · outbound

This paper cites Lib- rispeech: An ASR corpus based on public domain audio books,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Lib- rispeech: An ASR corpus based on public domain audio books,

Reference 36

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:58c67889434cc41c7da5c04ff5c5966b1363cd001915882f2bd45d1d680a99c3

Observation ab6a9c0b-3afe-40e0-9150-5e98d0008ff2 · outbound

This paper cites ECAPA2: a hybrid neural net- work architecture and training strategy for robust speaker embed- dings,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition ECAPA2: a hybrid neural net- work architecture and training strategy for robust speaker embed- dings,

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:ef6357d2e1cfd9a21f2c793221a8eef926d157de64686f765c5b0f806016e727

Observation 464ba1d2-b0fb-4563-bf84-daaabbcea227 · outbound

This paper cites Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Trans-tokenization and cross-lingual vocabulary transfers: language adaptation of LLMs for low-resource NLP,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:b3ffa74037b0c72b67c3bf6395748a3d22873192d26a7f23fb81cd2a4ea0463b

Observation feffa023-88b5-4fd3-88c2-4af5cbdad417 · outbound

This paper cites AlignFormer: Modality matching can achieve better zero-shot instruction- following speech-LLM,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition AlignFormer: Modality matching can achieve better zero-shot instruction- following speech-LLM,

Reference 39

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:1087fe1ccf1503a1e985910abdae552431c96decc047b7091131cf854fbfe00d

Observation c8f7c0ef-d25f-47f8-8e0a-65a1d4622628 · outbound

This paper cites The spoken Dutch corpus. overview and first evalu- ation,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition The spoken Dutch corpus. overview and first evalu- ation,

Reference 40

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:30c27a3b99d8faadbee15aa9d2ea926ae4f9f391215d423b9f571284c3480e90

Observation 66106ef6-4cfd-485c-be69-68355538d9b7 · outbound

This paper cites Seri- alized output training for end-to-end overlapped speech recogni- tion,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Seri- alized output training for end-to-end overlapped speech recogni- tion,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:7060f8ff8faadeb3e45217313da138e3c32f366f55e4534a74dc7d423a226e5b

Observation 39428aff-2077-43df-917f-e697a134724e · outbound

This paper cites The rich transcription 2007 meeting recognition evaluation,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition The rich transcription 2007 meeting recognition evaluation,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:1301f3854eccc8e66a926b6676092aef60105d5c4895c5f68694923cb5eb8505

Observation 9dfbb77c-492b-4d08-887e-995a839d3e90 · outbound

This paper cites Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Open ASR Leaderboard: Towards Reproducible and Transparent Multilingual Speech Recognition Evaluation

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:57:44.688641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:644057f83c31e092a3d7895863753fe1e4a22d88e1817d5e24e4e96a8f844fd5

Observation 3c489005-8d64-402a-a936-602886a09bba · outbound

This paper cites Evaluation of LLMs in speech is often flawed: Test set contamination in large language models for speech recognition,.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Evaluation of LLMs in speech is often flawed: Test set contamination in large language models for speech recognition,

Reference 44

Resolution
unresolved
no resolver link, observed 2026-06-27T11:32:58.335783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:c16aa24786a032966743957d9bb355ae3f5969dca20e3227af20df8ede306635

Pith citing papers

Observation f6f9d7b5-ca60-4e2a-bb2f-3f8d3fe1937f · inbound

Speech Encoder Fusion for LLM-based Automatic Speech Recognition cites this paper.

Speech Encoder Fusion for LLM-based Automatic Speech Recognition Speech Encoder Fusion for LLM-based Automatic Speech Recognition

Reference 2

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:57:44.680345Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.

source=pdf_text observed=2026-06-27T11:32:58.335783Z digest=sha256:ddb30ed4d0e3394b2fc2b4c53611fa25a84ccfb3a596fd314098fd8e12f7ae4a