Pith. sign in

Paper Citation Record · LEDGER

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

As of 14 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2606.10368.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2606.10368 v1

Coverage vector

measured 25 of 25 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-27T12:04:50.483329Z

measured 27 of 27 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-27T18:27:10.422343Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

25 of 25 outbound references displayed

  • verified exact18
  • verified fuzzy0
  • unresolved6
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

0
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

Observation eed0431e-a90f-4f89-942b-d2be5ab38cdc · outbound

This paper cites D.; Ho, J.; Tarlow, D.; and van den Berg, R.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation D.; Ho, J.; Tarlow, D.; and van den Berg, R

Reference 1

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e5894fd17dd2cff8e0c5245b44bdbf098a4900cf9d7cad1678acf4296419911e

Observation 6f78013a-d651-4cec-8e2f-400764c23311 · outbound

This paper cites TransFusion: Transcribing Speech with Multinomial Diffusion.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation TransFusion: Transcribing Speech with Multinomial Diffusion

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.919728Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:9d108357b648240e7f9f24b8150b25465a4ae537fd4de3bc691ff196b0c5670d

Observation 557aa51b-f847-4547-ab6e-a4b8b4f70542 · outbound

This paper cites Prompting Large Language Models with Speech Recognition Abilities.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Prompting Large Language Models with Speech Recognition Abilities

Reference 3

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.927640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e549faf3b075c62d963128f57134d74ae2db68c2b54326389ecdc48a4fd63609

Observation 9a660ae8-f036-47e5-b791-8b64ca1e19f4 · outbound

This paper cites Continuous Latent Diffusion Language Model.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Continuous Latent Diffusion Language Model

Reference 4

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.965510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:92aad83aa2ae1ebd1e8d67388ed6aaef8a526e44835e6bc34104009c480ad60f

Observation 4ae65cdf-290b-4a4e-86c9-ab96894a1099 · outbound

This paper cites Classifier-Free Diffusion Guidance.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Classifier-Free Diffusion Guidance

Reference 5

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.967712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:fa41f9ff5ddf0627c794aaab061db853afb46024eda2144fd3c5ef40ca1f94db

Observation eb47829e-7c1e-4950-a247-1b97655aebfe · outbound

This paper cites ELF: Embedded Language Flows.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation ELF: Embedded Language Flows

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.960405Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:05bbfb833a78d1e4bee35d48c6de362d2ab2903960a5efd38c4b808cc127a0bc

Observation 9343785d-3109-4dab-94d9-14735fc82308 · outbound

This paper cites Whisfusion: Parallel ASR Decoding with Masked Diffusion.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Whisfusion: Parallel ASR Decoding with Masked Diffusion

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.958180Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:af787034e54c968b550bf0761043ae09801d318a3661556a738089729ff84fe0

Observation af26b459-ad70-4ae0-926e-665a5b91c5a1 · outbound

This paper cites The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio

Reference 8

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.948394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:1724f9c32e02988a888dca93e92ccba23998ad3b3b9cd47585da12eb7438f95f

Observation e0c3d23d-ec70-4054-8a10-e679534f9dbc · outbound

This paper cites Flow Matching for Generative Modeling.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Flow Matching for Generative Modeling

Reference 9

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.955627Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:1cc68d15d99333055ff8388c0fb96ccc0084da7818fda721748776623f0e341f

Observation 7646612b-42a2-47cf-a2d8-61476aca2dbe · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:0bc5a55b0e07943f14f0f8624e1dc6e0d5f7b233edc92607532ed07b332b3609

Observation ea183f7d-918b-4e36-970f-7b983777c7f2 · outbound

This paper cites An Embarrassingly Simple Approach for LLM with Strong ASR Capacity.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation An Embarrassingly Simple Approach for LLM with Strong ASR Capacity

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.951000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:fd64ac4434fb48847071770926863c044b5675aae731d5845125e79e9bb394e3

Observation 8ca6e48f-af70-47fe-bfd7-a6de0398ca18 · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:56702f73360ed0271d753fbdbe6806c71df3d0426aff10e9fe7c0bacf176fc4a

Observation 8501cc49-74c5-4f43-8816-9fb3b662bbdb · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 13

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:91da310b109a3dfc6c045fbcb3e83951ffafe01a22355249e6ba5fef0c54a14f

Observation 244afa04-8b7b-4edb-afc3-c30304b88345 · outbound

This paper cites Robust Speech Recognition via Large-Scale Weak Supervision.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Robust Speech Recognition via Large-Scale Weak Supervision

Reference 14

Resolution
metadata mismatch
local_arxiv, observed 2026-07-03T07:27:44.943022Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:c940bc38743b109caad1e5dbdc27bc7a1c3b3e2579919a75ac199eee5e5ba99f

Observation 436fa945-165d-42df-8e00-c1dbdc6cefc3 · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 15

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.932389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:db27610bd68a83cbfeef25f89225165eab424e4689e9a2f120b9d39816ec999c

Observation b1952000-53c2-4d73-a9c5-e08f287f3a68 · outbound

This paper cites S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J

Reference 16

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:ba0049642b8ae304aa8c03149aaac3de7325eeaf07f4cd99a1a44f33068bbf2f

Observation 46bb7418-2aad-4f87-bfb2-c54f06791340 · outbound

This paper cites SeamlessM4T: Massively Multilingual & Multimodal Machine Translation.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation SeamlessM4T: Massively Multilingual & Multimodal Machine Translation

Reference 17

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.963055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:c13e39249a28c23bc8e325402c225e272e81b71162d8de8e3169de4facdbc4cc

Observation e39b7bde-9dcd-4893-ae80-8826df64c100 · outbound

This paper cites an unresolved cited work.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Unresolved cited work

Reference 18

Resolution
unresolved
no resolver link, observed 2026-06-27T12:04:50.483329Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:efa8231edcb2d7962e61a8695feced10316cab4a848abf4d727e783cde25d769

Observation 0fe00fc5-ce71-417a-ac73-62988a0f86e5 · outbound

This paper cites CoVoST 2 and Massively Multilingual Speech-to-Text Translation.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation CoVoST 2 and Massively Multilingual Speech-to-Text Translation

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.945646Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:e276763b7fc3391ac7ad4ca68fdb6e3f1b5f14e2c3ffc0e18b59d2494b6741e8

Observation 3667a07c-94e2-4be2-8936-8432bcc774f9 · outbound

This paper cites Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs

Reference 20

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.922554Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:b7002c936ce611d4dbbe7a6bff31fc92c79b6c4e54eba377958f5f8d1fb0cad5

Observation 0557267d-94f2-42bf-8900-6dedf3e3b4ab · outbound

This paper cites When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.940714Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:af7a8f0f3c3c79842031e068ec8cb3034160a1148608714bc6d21d9701068dba

Observation 2d5430d1-1a77-47c6-b1ea-3a32dd9c1dc1 · outbound

This paper cites Qwen2.5-Omni Technical Report.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Qwen2.5-Omni Technical Report

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.935145Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:ec2ba34fb8c7e728ce301a9bf2ebe68c464bf5359ae731df37bc70b25e57255b

Observation 78d114cd-c851-4025-8393-fc58bbcc7d7a · outbound

This paper cites Qwen3-Omni Technical Report.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Qwen3-Omni Technical Report

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-07-03T07:27:44.929821Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:750458c997f8dbc3aebf31bb744b35f2e54d17d66afa442cf378702f7bdc2774

Observation 34d1e018-43e1-48ea-a0a7-07fd4f3b0c90 · outbound

This paper cites Comparing Discrete and Continuous Space LLMs for Speech Recognition.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Comparing Discrete and Continuous Space LLMs for Speech Recognition

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.925129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:4e53c75a8353075c81ffac24a699eff472c3ea9af075b422e6ed3dda8452d14d

Observation ce16f5cc-2fe7-4e71-9cd8-be813efbbd8a · outbound

This paper cites Connecting Speech Encoder and Large Language Model for ASR.

Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation Connecting Speech Encoder and Large Language Model for ASR

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-03T07:27:44.953338Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-06-27T12:04:50.483329Z digest=sha256:0ac9c74df785cbfc08f1df1c58a7b02b042d5047e6cc6e1bc1c24ed289e627a6

Pith citing papers

Observation 73d7854d-9053-48c5-b156-189c349dc451 · inbound

Continuous Language Diffusion as a Decoder-Interface Problem cites this paper.

Continuous Language Diffusion as a Decoder-Interface Problem Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-07-02T23:07:27.066481Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T18:27:10.422343Z digest=sha256:8e1c6fc0ae725010aa097ea4974afc841b97e8796efb7f45abc93272495f4c6d

Observation a0bf6bc0-a788-498d-b7c4-1a2d3b5df3f1 · inbound

Continuous Language Diffusion as a Decoder-Interface Problem cites this paper.

Continuous Language Diffusion as a Decoder-Interface Problem Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation

Reference 41

Resolution
metadata mismatch
local_arxiv, observed 2026-06-27T18:31:07.845388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T18:27:10.422343Z digest=sha256:b9daefde4dcd2268c65e4505a87ebc1acc6dc9eff3b06f2e23ffaf3b0ec1eb97