{"as_of":"2026-08-14T13:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:64c852f71d992db0425a6779fc92f65575e227ff4c67c183c9d5af52decdd186","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T12:04:50.483329Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T18:27:10.422343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"cited_work":{"arxiv_id":"2606.10368","doi":"10.48550/arxiv.2606.10368","metadata_source":"pith","pith_arxiv_id":"2606.10368","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","venue":"cs.SD","work_id":"ab3fb142-8d07-4806-9cca-3c27ac8ac1ae","year":2026},"citing_paper":{"arxiv_id":"2606.08810","last_updated":"2026-06-15T19:27:43Z","snapshot_observed_at":"2026-08-13T14:06:40.885483Z","submitted_at":"2026-06-07T20:00:33Z","title":"Continuous Language Diffusion as a Decoder-Interface Problem","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T18:27:10.422343Z"},"links":{"cited_paper":"/paper/2606.10368","citing_paper":"/paper/2606.08810"},"observation_digest":"sha256:8e1c6fc0ae725010aa097ea4974afc841b97e8796efb7f45abc93272495f4c6d","observation_id":"73d7854d-9053-48c5-b156-189c349dc451","resolution":{"observed_at":"2026-07-02T23:07:27.066481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"cited_work":{"arxiv_id":"2606.10368","doi":"10.48550/arxiv.2606.10368","metadata_source":"pith","pith_arxiv_id":"2606.10368","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","venue":"cs.SD","work_id":"ab3fb142-8d07-4806-9cca-3c27ac8ac1ae","year":2026},"citing_paper":{"arxiv_id":"2606.08810","last_updated":"2026-06-15T19:27:43Z","snapshot_observed_at":"2026-08-13T14:06:40.885483Z","submitted_at":"2026-06-07T20:00:33Z","title":"Continuous Language Diffusion as a Decoder-Interface Problem","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T18:27:10.422343Z"},"links":{"cited_paper":"/paper/2606.10368","citing_paper":"/paper/2606.08810"},"observation_digest":"sha256:b9daefde4dcd2268c65e4505a87ebc1acc6dc9eff3b06f2e23ffaf3b0ec1eb97","observation_id":"a0bf6bc0-a788-498d-b7c4-1a2d3b5df3f1","resolution":{"observed_at":"2026-06-27T18:31:07.845388Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10368/citation-record","integrity":"/paper/2606.10368/integrity","json":"/paper/2606.10368/citation-record.json","paper":"/paper/2606.10368"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":"D.; Ho, J.; Tarlow, D.; and van den Berg, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e5894fd17dd2cff8e0c5245b44bdbf098a4900cf9d7cad1678acf4296419911e","observation_id":"eed0431e-a90f-4f89-942b-d2be5ab38cdc","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07677","last_updated":"2022-10-14T10:01:43Z","snapshot_observed_at":"2026-08-13T14:05:13.178983Z","submitted_at":"2022-10-14T10:01:43Z","title":"TransFusion: Transcribing Speech with Multinomial Diffusion","version":1},"cited_work":{"arxiv_id":"2210.07677","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.07677","snapshot_observed_at":"2026-07-03T07:27:44.918243Z","title":null,"venue":null,"work_id":"5aa4c680-494b-483a-a3ca-95fe881e4c8f","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2210.07677","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:9d108357b648240e7f9f24b8150b25465a4ae537fd4de3bc691ff196b0c5670d","observation_id":"6f78013a-d651-4cec-8e2f-400764c23311","resolution":{"observed_at":"2026-07-03T07:27:44.919728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.11795","last_updated":"2023-07-21T08:39:15Z","snapshot_observed_at":"2026-08-13T18:05:58.753060Z","submitted_at":"2023-07-21T08:39:15Z","title":"Prompting Large Language Models with Speech Recognition Abilities","version":1},"cited_work":{"arxiv_id":"2307.11795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.11795","snapshot_observed_at":"2026-07-03T07:27:44.926350Z","title":"arXiv preprint arXiv:2307.11795 , year=","venue":null,"work_id":"e008b9a4-101a-436f-a6ae-e8d400851cd6","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2307.11795","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e549faf3b075c62d963128f57134d74ae2db68c2b54326389ecdc48a4fd63609","observation_id":"557aa51b-f847-4547-ab6e-a4b8b4f70542","resolution":{"observed_at":"2026-07-03T07:27:44.927640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06548","last_updated":"2026-05-07T16:44:56Z","snapshot_observed_at":"2026-08-04T07:00:09.042412Z","submitted_at":"2026-05-07T16:44:56Z","title":"Continuous Latent Diffusion Language Model","version":1},"cited_work":{"arxiv_id":"2605.06548","doi":"10.48550/arxiv.2605.06548","metadata_source":"pith","pith_arxiv_id":"2605.06548","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Continuous Latent Diffusion Language Model","venue":"cs.CL","work_id":"5f19a694-f3ea-4efa-bf6e-ac012b4c2e27","year":2026},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2605.06548","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:92aad83aa2ae1ebd1e8d67388ed6aaef8a526e44835e6bc34104009c480ad60f","observation_id":"9a660ae8-f036-47e5-b791-8b64ca1e19f4","resolution":{"observed_at":"2026-07-03T07:27:44.965510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:fa41f9ff5ddf0627c794aaab061db853afb46024eda2144fd3c5ef40ca1f94db","observation_id":"4ae65cdf-290b-4a4e-86c9-ab96894a1099","resolution":{"observed_at":"2026-07-03T07:27:44.967712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10938","last_updated":"2026-06-26T03:16:31Z","snapshot_observed_at":"2026-08-13T00:17:25.829130Z","submitted_at":"2026-05-11T17:59:29Z","title":"ELF: Embedded Language Flows","version":2},"cited_work":{"arxiv_id":"2605.10938","doi":"10.48550/arxiv.2605.10938","metadata_source":"pith","pith_arxiv_id":"2605.10938","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ELF: Embedded Language Flows","venue":"cs.CL","work_id":"ac23aed7-56a6-4484-a213-8450a834a983","year":2026},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2605.10938","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:05bbfb833a78d1e4bee35d48c6de362d2ab2903960a5efd38c4b808cc127a0bc","observation_id":"eb47829e-7c1e-4950-a247-1b97655aebfe","resolution":{"observed_at":"2026-07-03T07:27:44.960405Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07048","last_updated":"2026-06-09T07:22:42Z","snapshot_observed_at":"2026-08-05T22:23:25.931700Z","submitted_at":"2025-08-09T17:20:54Z","title":"Whisfusion: Parallel ASR Decoding with Masked Diffusion","version":2},"cited_work":{"arxiv_id":"2508.07048","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.07048","snapshot_observed_at":"2026-07-03T07:27:44.956979Z","title":"Whisfusion: Paral- lel ASR Decoding via a Diffusion Transformer","venue":"cs.SD","work_id":"5788151b-96f6-48ff-a72a-6c19b3c634c9","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.07048","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:af787034e54c968b550bf0761043ae09801d318a3661556a738089729ff84fe0","observation_id":"9343785d-3109-4dab-94d9-14735fc82308","resolution":{"observed_at":"2026-07-03T07:27:44.958180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-08-12T22:21:38.215274Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":"2410.12787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-07-04T19:20:06.441655Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio","venue":null,"work_id":"6d0e2ec6-1001-4f21-aa0f-536eda860043","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:1724f9c32e02988a888dca93e92ccba23998ad3b3b9cd47585da12eb7438f95f","observation_id":"af26b459-ad70-4ae0-926e-665a5b91c5a1","resolution":{"observed_at":"2026-07-03T07:27:44.948394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:1cc68d15d99333055ff8388c0fb96ccc0084da7818fda721748776623f0e341f","observation_id":"e0c3d23d-ec70-4054-8a10-e679534f9dbc","resolution":{"observed_at":"2026-07-03T07:27:44.955627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:0bc5a55b0e07943f14f0f8624e1dc6e0d5f7b233edc92607532ed07b332b3609","observation_id":"7646612b-42a2-47cf-a2d8-61476aca2dbe","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-13T04:19:27.486516Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":"2402.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-07-10T20:37:34.440026Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity","venue":"cs.CL","work_id":"d0cf5313-bc88-4f8f-9a2c-9012a25a93dd","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:fd64ac4434fb48847071770926863c044b5675aae731d5845125e79e9bb394e3","observation_id":"ea183f7d-918b-4e36-970f-7b983777c7f2","resolution":{"observed_at":"2026-07-03T07:27:44.951000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:56702f73360ed0271d753fbdbe6806c71df3d0426aff10e9fe7c0bacf176fc4a","observation_id":"8ca6e48f-af70-47fe-bfd7-a6de0398ca18","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:91da310b109a3dfc6c045fbcb3e83951ffafe01a22355249e6ba5fef0c54a14f","observation_id":"8501cc49-74c5-4f43-8816-9fb3b662bbdb","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:c940bc38743b109caad1e5dbdc27bc7a1c3b3e2579919a75ac199eee5e5ba99f","observation_id":"244afa04-8b7b-4edb-afc3-c30304b88345","resolution":{"observed_at":"2026-07-03T07:27:44.943022Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:db27610bd68a83cbfeef25f89225165eab424e4689e9a2f120b9d39816ec999c","observation_id":"436fa945-165d-42df-8e00-c1dbdc6cefc3","resolution":{"observed_at":"2026-07-03T07:27:44.932389Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":"S.; Arriola, M.; Schiff, Y.; Gokaslan, A.; Marroquin, E.; Chiu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:ba0049642b8ae304aa8c03149aaac3de7325eeaf07f4cd99a1a44f33068bbf2f","observation_id":"b1952000-53c2-4d73-a9c5-e08f287f3a68","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-13T10:29:31.823796Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":"2308.11596","doi":"10.48550/arxiv.2308.11596","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"C.; Dale, D.; Dong, N.; Duquenne, P.-A.; Elsahar, H.; Gong, H.; Heffernan, K.; Hoffman, J.; et al","venue":"arXiv (Cornell University)","work_id":"9b58185d-8084-4802-9271-58d052a5af84","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:c13e39249a28c23bc8e325402c225e272e81b71162d8de8e3169de4facdbc4cc","observation_id":"46bb7418-2aad-4f87-bfb2-c54f06791340","resolution":{"observed_at":"2026-07-03T07:27:44.963055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T12:04:50.483329Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:efa8231edcb2d7962e61a8695feced10316cab4a848abf4d727e783cde25d769","observation_id":"e39b7bde-9dcd-4893-ae80-8826df64c100","resolution":{"observed_at":"2026-06-27T12:04:50.483329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-09T21:19:30.065131Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":"2007.10310","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-07-04T20:30:07.211214Z","title":"Covost 2 and massively multilingual speech-to-text translation","venue":null,"work_id":"6c9bffaf-0bd1-4fa9-ac70-56e01e042f08","year":2007},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:e276763b7fc3391ac7ad4ca68fdb6e3f1b5f14e2c3ffc0e18b59d2494b6741e8","observation_id":"0fe00fc5-ce71-417a-ac73-62988a0f86e5","resolution":{"observed_at":"2026-07-03T07:27:44.945646Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:b7002c936ce611d4dbbe7a6bff31fc92c79b6c4e54eba377958f5f8d1fb0cad5","observation_id":"3667a07c-94e2-4be2-8936-8432bcc774f9","resolution":{"observed_at":"2026-07-03T07:27:44.922554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10552","last_updated":"2025-08-14T11:44:52Z","snapshot_observed_at":"2026-08-09T07:24:43.212927Z","submitted_at":"2025-08-14T11:44:52Z","title":"When Language Overrules: Revealing Text Dominance in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2508.10552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10552","snapshot_observed_at":"2026-07-04T11:59:50.274843Z","title":"When language overrules: Modality imbalance in vlms","venue":null,"work_id":"beb44eef-1d39-40a7-98b3-80a16cfe93bb","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.10552","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:af7a8f0f3c3c79842031e068ec8cb3034160a1148608714bc6d21d9701068dba","observation_id":"0557267d-94f2-42bf-8900-6dedf3e3b4ab","resolution":{"observed_at":"2026-07-03T07:27:44.940714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:ec2ba34fb8c7e728ce301a9bf2ebe68c464bf5359ae731df37bc70b25e57255b","observation_id":"2d5430d1-1a77-47c6-b1ea-3a32dd9c1dc1","resolution":{"observed_at":"2026-07-03T07:27:44.935145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:750458c997f8dbc3aebf31bb744b35f2e54d17d66afa442cf378702f7bdc2774","observation_id":"78d114cd-c851-4025-8393-fc58bbcc7d7a","resolution":{"observed_at":"2026-07-03T07:27:44.929821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00800","last_updated":"2024-09-01T18:29:45Z","snapshot_observed_at":"2026-08-12T22:53:32.270480Z","submitted_at":"2024-09-01T18:29:45Z","title":"Comparing Discrete and Continuous Space LLMs for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2409.00800","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00800","snapshot_observed_at":"2026-07-03T07:27:44.923721Z","title":null,"venue":null,"work_id":"aca74839-5be6-47e9-ab15-33a54474415f","year":2024},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2409.00800","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:4e53c75a8353075c81ffac24a699eff472c3ea9af075b422e6ed3dda8452d14d","observation_id":"34d1e018-43e1-48ea-a0a7-07fd4f3b0c90","resolution":{"observed_at":"2026-07-03T07:27:44.925129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13963","last_updated":"2023-09-26T11:09:25Z","snapshot_observed_at":"2026-08-13T10:05:44.200896Z","submitted_at":"2023-09-25T08:57:07Z","title":"Connecting Speech Encoder and Large Language Model for ASR","version":2},"cited_work":{"arxiv_id":"2309.13963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.13963","snapshot_observed_at":"2026-07-03T07:27:44.952065Z","title":"arXiv preprint arXiv:2309.13963 , year=","venue":null,"work_id":"f43d4d9c-6510-4e8d-a0bd-ecb2c555153b","year":2023},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2309.13963","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:0ac9c74df785cbfc08f1df1c58a7b02b042d5047e6cc6e1bc1c24ed289e627a6","observation_id":"ce16f5cc-2fe7-4e71-9cd8-be813efbbd8a","resolution":{"observed_at":"2026-07-03T07:27:44.953338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":6,"verified_exact":18,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 2 inbound Pith citation observations for arXiv:2606.10368."}