{"as_of":"2026-08-20T13:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bba174d9561023d54da624ff7d02b62bda14ca288295a9573112def10cdd3f44","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:18:01.876712Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.02370/citation-record","integrity":"/paper/2501.02370/integrity","json":"/paper/2501.02370/citation-record.json","paper":"/paper/2501.02370"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.448832Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.448832Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ffcb304877cea8998c1608ed769c6e85c5ee343ead01952b344b7a03070b135c","observation_id":"0f3b9c67-05fa-4f7a-8bf9-5a49f7184a13","resolution":{"observed_at":"2026-08-10T22:18:01.448832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.455015Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.455015Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e28bbbc25b963a69e80505e4470d3262073a07b5710c29bb17cad97c262f1280","observation_id":"e6c487ac-5620-44b7-8e09-33629c904bcd","resolution":{"observed_at":"2026-08-10T22:18:01.455015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.461178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.461178Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:8fea752a3d9ec700612b8b2332ddd5219b5e0234735c6443612e918c93927881","observation_id":"0b4a17ef-b74b-4526-98e5-a84dd5879d8e","resolution":{"observed_at":"2026-08-10T22:18:01.461178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07205","last_updated":"2022-05-24T08:18:31Z","snapshot_observed_at":"2026-08-16T17:49:25.509132Z","submitted_at":"2021-10-14T07:59:27Z","title":"SpeechT5: Unified-Modal Encoder-Decoder Pre-Training for Spoken Language Processing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07205","snapshot_observed_at":"2026-08-10T22:18:01.466667Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.466667Z"},"links":{"cited_paper":"/paper/2110.07205","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:a1c04756d1ad59e7df9780195121ce5948d0b8cbdb9f1f5a83d169343e727230","observation_id":"c5fb2eb8-c6ac-495a-b8c4-797fc17f1434","resolution":{"observed_at":"2026-08-10T22:18:01.466667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.513229Z","title":null,"venue":null,"work_id":"42422641-7f88-450b-aad6-8eb4df240204","year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.472850Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5bc215b03b53c6b73284c9d7ab7d01cf6c9360759c07f436f1aeb28bd6932a8d","observation_id":"00681776-ef60-4a60-8c94-5e2a3a3247d6","resolution":{"observed_at":"2026-08-10T22:18:03.519305Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11596","last_updated":"2023-10-25T03:52:07Z","snapshot_observed_at":"2026-08-16T15:06:35.991757Z","submitted_at":"2023-08-22T17:44:18Z","title":"SeamlessM4T: Massively Multilingual & Multimodal Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11596","snapshot_observed_at":"2026-08-10T22:18:01.478377Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.478377Z"},"links":{"cited_paper":"/paper/2308.11596","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:78af8d59ebb5cd7f00e419688658a690fcfc648303098f3127b53963eebc0eaa","observation_id":"2cbddd3e-636f-447e-9c0b-2b184ddb2405","resolution":{"observed_at":"2026-08-10T22:18:01.478377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.495615Z","title":null,"venue":null,"work_id":"05f12280-e61a-43ab-ba31-a5260f91242b","year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.484075Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5d249c4f10605645197c75f0512d8ccc93774d813dc5c24f3ef9f144c0ab7f19","observation_id":"2a26895a-ffd2-4510-8ed0-23822735c55b","resolution":{"observed_at":"2026-08-10T22:18:03.500520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01744","last_updated":"2016-12-06T10:48:56Z","snapshot_observed_at":"2026-08-14T21:26:55.522063Z","submitted_at":"2016-12-06T10:48:56Z","title":"Listen and Translate: A Proof of Concept for End-to-End Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01744","snapshot_observed_at":"2026-08-10T22:18:01.489299Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.489299Z"},"links":{"cited_paper":"/paper/1612.01744","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:cf347ad43efa152c2d6c72d5633d93ca6ba032f363ed1dd7c88646619fbef553","observation_id":"9d04f292-3889-4c34-8ced-6301b562e8fd","resolution":{"observed_at":"2026-08-10T22:18:01.489299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T22:18:01.495695Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.495695Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:a7beed151aa9ed718475c228a7ab105954c3c445f6624ee5b050ef63d9be039c","observation_id":"74368e12-e5ec-4696-8e83-edd0f44976db","resolution":{"observed_at":"2026-08-10T22:18:01.495695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.500795Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.500795Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:661795c70c48d7bfd260ee827fce18740163c9dceb86e3090118f3c197786cc0","observation_id":"98577954-92cd-496f-af45-0363a881fa0d","resolution":{"observed_at":"2026-08-10T22:18:01.500795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-08-14T22:37:33.413960Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-08-10T22:18:01.505886Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.505886Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:59f0b13e44e4f208d7b8ff1c172f59f90c61981dd7e2b6e8afcd9c9f4c140631","observation_id":"c57b96bd-cf23-4998-bd38-e087f706bb27","resolution":{"observed_at":"2026-08-10T22:18:01.505886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-17T18:21:22.894737Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-10T22:18:01.511482Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.511482Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:701ff27c9bce5611871e86506ae908681500ca4aae54c50239d69523742bdcf1","observation_id":"97e5cbe5-2c95-4895-86a2-30664262a0a3","resolution":{"observed_at":"2026-08-10T22:18:01.511482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.416","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.291186Z","title":null,"venue":null,"work_id":"7df82ff6-1a0d-4309-b1d0-0032e16e70b7","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.517081Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:684ade8f833f3221848bbde5b15a11f1948c449aec525c8962a2fdc1dc168359","observation_id":"307c7a12-9d78-4dda-8972-ec0762f8bffb","resolution":{"observed_at":"2026-08-10T22:18:02.297511Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.479247Z","title":null,"venue":null,"work_id":"aa0104c3-6cb5-44fe-9390-7633af10f656","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.522137Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ab7e60a3e84ad489157483cd81faab2af976e7c22c06598d37dd0308b25e1764","observation_id":"1969d1a8-c8df-4690-8436-94d3999077bb","resolution":{"observed_at":"2026-08-10T22:18:03.484626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19954","last_updated":"2024-06-28T14:40:03Z","snapshot_observed_at":"2026-08-16T13:38:43.539265Z","submitted_at":"2024-06-28T14:40:03Z","title":"BESTOW: Efficient and Streamable Speech Language Model with the Best of Two Worlds in GPT and T5","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19954","snapshot_observed_at":"2026-08-10T22:18:01.526989Z","title":"Puvvada, Nithin Rao Koluguri, Piotr Żelasko, Jagadeesh Balam, and Boris Ginsburg","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.526989Z"},"links":{"cited_paper":"/paper/2406.19954","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:532852e28be231fcfe649687970d755d7f524473a2686bc706ea72afb1d6e077","observation_id":"1880c362-05f2-4d71-a28b-ff22d270cc57","resolution":{"observed_at":"2026-08-10T22:18:01.526989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-10T22:18:01.532170Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.532170Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:0d52b85341669462edfc86c20e9f91a4a2a1173625c6584241df3a5aa4d58056","observation_id":"72d40374-923b-48ca-8cad-cc33ea7bb60c","resolution":{"observed_at":"2026-08-10T22:18:01.532170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-10T22:18:01.537186Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.537186Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:324e7e3306162fb05c87834f67984b08675e0bee7ee97e0e6fb8aca8a614c071","observation_id":"a02aebfe-1914-42a6-af68-14ac5762e034","resolution":{"observed_at":"2026-08-10T22:18:01.537186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.542521Z","title":"Di Gangi, Roldano Cattoni, Luisa Bentivogli, Matteo Negri, and Marco Turchi","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.542521Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:8faafa0167e504b2d73b48201249d4a4ca59a5790c376d2492ef1bf491326484","observation_id":"f0674089-193f-4071-9c26-11a92076e2ae","resolution":{"observed_at":"2026-08-10T22:18:01.542521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.461523Z","title":null,"venue":null,"work_id":"b304b628-1bdd-4c41-ae9e-24f2be533d9e","year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.547880Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1066d64608a42699a85a7c3f5b3707fd85bc8d116184c23a68daa77eef43cbac","observation_id":"ff73b565-cb79-408f-973b-3990f54efd73","resolution":{"observed_at":"2026-08-10T22:18:03.467338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.553570Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.553570Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:a6da30cd329fa43c649fd5ed5d8a14aa1cfdc7bf1587aa73638cdcb9001fe855","observation_id":"4f598268-324a-4286-8dd8-5d40c1c8453a","resolution":{"observed_at":"2026-08-10T22:18:01.553570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.445156Z","title":null,"venue":null,"work_id":"2a285c94-f352-4757-9837-e9efbd2b88ac","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.558447Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9678e7b04f4f9c52166db060a0a7ab9a5ae217ea06c1fa628b9f3c9476dd4e16","observation_id":"63aed7e9-80d5-461c-85a1-03212c2050dd","resolution":{"observed_at":"2026-08-10T22:18:03.450486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.563366Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.563366Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:bb990413a7bb1139fc74107c259fa81169ebcaed8521726d72e527757ee7f53b","observation_id":"b1c261b1-4c9d-4a98-a3ba-f6ff39dbf4ae","resolution":{"observed_at":"2026-08-10T22:18:01.563366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.iwslt-1.13","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.207939Z","title":null,"venue":null,"work_id":"f555ee6b-443b-4633-9c80-e9857239cfef","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.568325Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:217312dcb3ecbd29b346d7d0cf1944a9153654ff84ba39f7e2038674819fd0f7","observation_id":"5434c9e8-0a74-4150-b062-866bcce2a019","resolution":{"observed_at":"2026-08-10T22:18:02.216980Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.574114Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.574114Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:78f1453c33f12b1a164b4beb38463ceba78a54524e96c83ee879544bfd9643fd","observation_id":"19cf8ee4-d37b-4e0e-9258-6277cd896d8e","resolution":{"observed_at":"2026-08-10T22:18:01.574114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.579165Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.579165Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:327d0974e668c90a05756fcce5c32d20ea27b7fc47bff9e53a5c97a1ac76be57","observation_id":"244d2d17-71da-4dfa-a609-1ebf6f162b4c","resolution":{"observed_at":"2026-08-10T22:18:01.579165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.584589Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.584589Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:48741bfb332eb45a29f7d3b0a55a89a9e6a5622e55994883b8db4b7a1e9a913b","observation_id":"f8cd1f14-14f0-4fc8-928e-f052921a25ff","resolution":{"observed_at":"2026-08-10T22:18:01.584589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-565","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.150018Z","title":null,"venue":null,"work_id":"2c40bab0-7617-414a-91d6-e315f126c66a","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.589891Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:6734848b1d38431917609039bd09c19bdeaa66f188983f5c938355b9cabb65f2","observation_id":"6da82df2-b3aa-46bb-91c9-5b3008b8003f","resolution":{"observed_at":"2026-08-10T22:18:02.157931Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.787","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.125516Z","title":null,"venue":null,"work_id":"98ca46f4-c973-4878-8a59-264894bc233e","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.594610Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:77e462ac63cdfac69cf35b6372ccca651c659d6c989cb554551ee7150a17a390","observation_id":"e0f6b5d2-e2d3-495f-b902-18f169f5a594","resolution":{"observed_at":"2026-08-10T22:18:02.131824Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T23:59:29.658982Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T22:18:01.599424Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.599424Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:9504df6af5af007ac9e2a5b8fb3797c056c86ccad15fc49a08f7eedf0a2c9cfc","observation_id":"df371e8f-507e-43ae-8b4e-3424983f3466","resolution":{"observed_at":"2026-08-10T22:18:01.599424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03169","last_updated":"2024-07-03T14:42:49Z","snapshot_observed_at":"2026-08-16T13:37:21.487414Z","submitted_at":"2024-07-03T14:42:49Z","title":"Investigating Decoder-only Large Language Models for Speech-to-text Translation","version":1},"cited_work":{"arxiv_id":"2407.03169","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03169","snapshot_observed_at":"2026-08-10T22:18:02.932112Z","title":"Investigating Decoder-only Large Language Models for Speech-to-text Translation","venue":"cs.CL","work_id":"474654db-1f62-4d26-a23f-df195ab7b443","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.604423Z"},"links":{"cited_paper":"/paper/2407.03169","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:08a33ed66b4d48b37fd39f8dd80e0d5849a8604d4e1b7861dddc89c80d9473f6","observation_id":"92e0aa0a-c532-4b8b-b187-eb395f6f779d","resolution":{"observed_at":"2026-08-10T22:18:02.937954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.419347Z","title":null,"venue":null,"work_id":"308f32aa-a57e-4fc2-a197-ef5a83d80eef","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.609511Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5d3e6a8aee1393d1f19e0168d217299b45e285b6b7bde1c1a75eb5c20f2c622d","observation_id":"4e97a6a2-584e-4b67-b218-fafbb27dba81","resolution":{"observed_at":"2026-08-10T22:18:03.424437Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.naacl-main.150","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.100760Z","title":null,"venue":null,"work_id":"53df0fa8-c46a-4d32-a397-b6e54f397b6f","year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.615827Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:efb9fdfb55a170d89b97f2860812072d15fb70f2387ba18b9fe3617196985282","observation_id":"8c847965-af42-4aef-bb62-18c628730887","resolution":{"observed_at":"2026-08-10T22:18:02.106711Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T22:18:01.621418Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.621418Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ddc61df329de21f82d0cb28581e522b72af4f080a2edc814a515512cddf2d551","observation_id":"ae5c7f6d-a245-4092-b0d6-ece5797f5c75","resolution":{"observed_at":"2026-08-10T22:18:01.621418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.626619Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.626619Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:44643a912fc74c4dcaf3f54f65c4eae56597dae40e2cb056c7a055fd552d5c39","observation_id":"7856850b-884c-4fc6-8192-6dbbb2df1237","resolution":{"observed_at":"2026-08-10T22:18:01.626619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.632173Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.632173Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:214c5413132b8d41dcfbd400d59f36734bb5dc298120fe1b7e8bf5bf63aaa186","observation_id":"fcca62ab-ab44-41ce-843d-d24e3073b5a5","resolution":{"observed_at":"2026-08-10T22:18:01.632173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.637237Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.637237Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:7b87b12484437f5c5b8dacfd47dc23c6b187e690c785e78d1fe88150b0cd0d9a","observation_id":"3b01ca19-9c4c-40e5-80de-73d21c0b79b1","resolution":{"observed_at":"2026-08-10T22:18:01.637237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.643157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.643157Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:76378a745a05d012b8c837720b5059cc3c06bf1d4acbe4e2547d008856e2d5c4","observation_id":"8616c69c-db18-47df-aa44-57a6322e35ae","resolution":{"observed_at":"2026-08-10T22:18:01.643157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.648424Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.648424Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f3e3de24590e385ccf203d510f66f7eeb589e2dbabc80d03af970523c235f048","observation_id":"d8ec79a6-45d1-4b9c-b645-645dca211bcf","resolution":{"observed_at":"2026-08-10T22:18:01.648424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.376500Z","title":null,"venue":null,"work_id":"0d37740a-3a4b-4b03-ac88-c0744cbad3c3","year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.653492Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:73e7a9e0ef37b516a927a3987ab94e9367873770b31ac4f6870c62350611d3c2","observation_id":"0115e4cf-721c-4f46-9eb9-de17847d53eb","resolution":{"observed_at":"2026-08-10T22:18:03.381856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12792","last_updated":"2023-09-22T01:44:46Z","snapshot_observed_at":"2026-08-18T23:30:52.275198Z","submitted_at":"2023-08-24T13:47:16Z","title":"Sparks of Large Audio Models: A Survey and Outlook","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12792","snapshot_observed_at":"2026-08-10T22:18:01.658865Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.658865Z"},"links":{"cited_paper":"/paper/2308.12792","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:7c33ae13aa4956995a8f8ddf2e4191cb717646819f3f90dbfde2aabab73805d1","observation_id":"8799987d-4c64-45a9-be1c-410a45cd3d9c","resolution":{"observed_at":"2026-08-10T22:18:01.658865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03900","last_updated":"2024-08-07T16:55:28Z","snapshot_observed_at":"2026-08-16T13:27:54.844364Z","submitted_at":"2024-08-07T16:55:28Z","title":"Speech-MASSIVE: A Multilingual Speech Dataset for SLU and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03900","snapshot_observed_at":"2026-08-10T22:18:01.663850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.663850Z"},"links":{"cited_paper":"/paper/2408.03900","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:48b4392ac3173d6073c37db487efebf8c540ab94d179aaf65e3e5c3c84ee5c3a","observation_id":"256b2189-67b7-47ef-a118-8261b5c7fd61","resolution":{"observed_at":"2026-08-10T22:18:01.663850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.358287Z","title":null,"venue":null,"work_id":"666e9a03-3928-4d66-933c-7c93d8914598","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.669010Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:45a59600b9975360cbb8c1078d5c43d485d91b8f707ed961cc0213905216ae65","observation_id":"806e12d1-8eb8-47a9-aed8-cb59242914d9","resolution":{"observed_at":"2026-08-10T22:18:03.363918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14920","last_updated":"2020-10-28T12:33:04Z","snapshot_observed_at":"2026-08-16T19:09:58.160373Z","submitted_at":"2020-10-28T12:33:04Z","title":"Bridging the Modality Gap for Speech-to-Text Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14920","snapshot_observed_at":"2026-08-10T22:18:01.676462Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.676462Z"},"links":{"cited_paper":"/paper/2010.14920","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:39090102b4bba9ff02686d942cc0d067dbe3066a547a4d53f12f79cbcf3fe173","observation_id":"e3cd9b70-8b15-47fd-b296-a2514ce960d1","resolution":{"observed_at":"2026-08-10T22:18:01.676462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8356.24688","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:02.815050Z","title":null,"venue":null,"work_id":"ab4d8dba-b30d-43b1-bcfb-c4682609c74f","year":2013},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.682072Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:d9863ba72adc0b8a2cd1e8ec2322d990fbf7c7b19aa52034cb43c52012334ad9","observation_id":"cdb43061-e459-472f-b3f2-da6fab3196c9","resolution":{"observed_at":"2026-08-10T22:18:02.824558Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.687235Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.687235Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:c52aa31beda556429493fe8d5a186238445b7fab93515cc016ae1ab8252bd715","observation_id":"466f143f-f364-478c-b65d-e4e593f55972","resolution":{"observed_at":"2026-08-10T22:18:01.687235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02248","last_updated":"2024-06-14T17:57:13Z","snapshot_observed_at":"2026-08-16T14:46:05.128165Z","submitted_at":"2023-11-03T21:47:03Z","title":"COSMIC: Data Efficient Instruction-tuning For Speech In-Context Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02248","snapshot_observed_at":"2026-08-10T22:18:01.693105Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.693105Z"},"links":{"cited_paper":"/paper/2311.02248","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:8289703e4d843ff96ad8f5b1b2127bd171f6b172cba79dbc71d61f88ac8ea3de","observation_id":"36cd5e72-c0b7-4a5e-96fc-e1f6397f3ac3","resolution":{"observed_at":"2026-08-10T22:18:01.693105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.698618Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.698618Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f42e8214eecaa4645eec9e5d74a6089c5f352671bbd8e14faa693ef3a4257de5","observation_id":"246de955-aec3-410f-a4e0-3c73c6c6d1a6","resolution":{"observed_at":"2026-08-10T22:18:01.698618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18495","last_updated":"2024-12-24T15:26:31Z","snapshot_observed_at":"2026-08-19T06:07:18.331684Z","submitted_at":"2024-12-24T15:26:31Z","title":"How \"Real\" is Your Real-Time Simultaneous Speech-to-Text Translation System?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18495","snapshot_observed_at":"2026-08-10T22:18:01.704779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.704779Z"},"links":{"cited_paper":"/paper/2412.18495","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:400cc467b7b06ec03275d7e14ffefa77e59d8296bfd6ff22796581ce535e7ec0","observation_id":"e4057a89-793b-438e-a24d-9f910f5a11fc","resolution":{"observed_at":"2026-08-10T22:18:01.704779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.710676Z","title":"Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.710676Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:cb9680de1f48bf5847694c6ced5844fb9b11eb02ca808672255d619de9166fbf","observation_id":"f719ed18-019d-4485-ba60-dfa1a8cbb67e","resolution":{"observed_at":"2026-08-10T22:18:01.710676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.718564Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.718564Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:5a05745620654fad27d1d1de6aa13a58808abc811f53c098b14fd61409ebf518","observation_id":"3209d94a-e7e1-45ff-859a-b2e20fa5ceba","resolution":{"observed_at":"2026-08-10T22:18:01.718564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.724578Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.724578Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:43245096731e26096240063ff729676d4295ded53a8c1bd500ac70efd9521edf","observation_id":"4d804dca-fb92-44b3-8cc1-071290405279","resolution":{"observed_at":"2026-08-10T22:18:01.724578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.730703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.730703Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:93407507f35f6c9dafa0d8b997d24812c138ab5083e29c568ff127d0a402d782","observation_id":"69a02b05-5d6d-4b4e-b1ee-e0c005a3b919","resolution":{"observed_at":"2026-08-10T22:18:01.730703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.739051Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.739051Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:98a783a8cd0d3ced0cc5966e6be5ae0fbf491fbf18101c8ce5cf4ad6f33115c3","observation_id":"edcbf2c9-c3c0-4f04-bd45-b7937242395b","resolution":{"observed_at":"2026-08-10T22:18:01.739051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.749335Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.749335Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:d31da6c698a39277e5c459ad1b86ceb45cf7d584035bdb1124868a80b713aac8","observation_id":"4da58c74-06dc-4733-93b5-c4d7593c3af8","resolution":{"observed_at":"2026-08-10T22:18:01.749335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.759295Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.759295Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:ae2ddd657ff5b1d53cedef50747f38f4301f472a1d53a583eaac753457ff92dc","observation_id":"1fba9d1e-d065-4ba1-949c-e8de8356654b","resolution":{"observed_at":"2026-08-10T22:18:01.759295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-10T22:18:01.765430Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.765430Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e6c60e7b963a65736af297a8590168f34826f2d38ac5fc28bd11357c2a2cb10c","observation_id":"6a6f444c-2183-44cf-ab36-322bbcb87733","resolution":{"observed_at":"2026-08-10T22:18:01.765430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T22:18:01.773692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.773692Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b05b22195f88613a88b3ae3c54ab79e86eb93c3550ebf8165300b90f5602e1df","observation_id":"4ed36dde-8573-4f60-8e79-f392e325972d","resolution":{"observed_at":"2026-08-10T22:18:01.773692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:18:01.779841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.779841Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1ceb8a1c3a0afb7f16f9157bbd1e2d65dfaf13376dbb4a008455126cb5477092","observation_id":"46f9c9c7-73d9-47be-b23f-91df747c0546","resolution":{"observed_at":"2026-08-10T22:18:01.779841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.786265Z","title":"G \\'a llego, Jos \\'e A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.786265Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:8cd19a6f52b81e0fbe3de3d026e5e67fa3f167912e5a9da42563f8167ef9ca54","observation_id":"203e68d0-e43c-453f-94bb-ab6fe7c00206","resolution":{"observed_at":"2026-08-10T22:18:01.786265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2022-59","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.965753Z","title":"Gállego, José A","venue":null,"work_id":"8218ea54-47ed-4de6-8bc6-145f29c9310c","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.791567Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b1271db2728bf12c1807471a27e6910002ec8b07e431087e2fcc8a2c08842c1d","observation_id":"7a2a09cc-e600-4eb8-af59-8b27d1c38858","resolution":{"observed_at":"2026-08-10T22:18:01.970986Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08876","last_updated":"2024-01-09T09:02:23Z","snapshot_observed_at":"2026-08-16T15:00:12.894169Z","submitted_at":"2023-09-16T04:57:37Z","title":"Decoder-only Architecture for Speech Recognition with CTC Prompts and Text Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08876","snapshot_observed_at":"2026-08-10T22:18:01.797969Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.797969Z"},"links":{"cited_paper":"/paper/2309.08876","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:cccef51768be187d0eff951f51707c4d1e5122a47665b37cfd89ea8fb001d2a6","observation_id":"e53bfefd-adc3-4cb6-9abb-cdd0ff7e0f80","resolution":{"observed_at":"2026-08-10T22:18:01.797969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16107","last_updated":"2024-08-01T13:55:54Z","snapshot_observed_at":"2026-08-17T05:28:50.086960Z","submitted_at":"2024-06-23T13:50:08Z","title":"Decoder-only Architecture for Streaming End-to-end Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16107","snapshot_observed_at":"2026-08-10T22:18:01.804040Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.804040Z"},"links":{"cited_paper":"/paper/2406.16107","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:1a5b174549abc7ee13a1a55c4876c3a8d0858c6b5ae0e0810d9cd625d80f22d2","observation_id":"968d45f1-92ec-4447-9021-36170cbc3b77","resolution":{"observed_at":"2026-08-10T22:18:01.804040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.811218Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.811218Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:bb082546cf502fafc57cb35803223fbb01a14f6a85fa25e6a1d13e328ddc8899","observation_id":"c7c732f0-f88c-4ff2-8108-13a27d9f7fbe","resolution":{"observed_at":"2026-08-10T22:18:01.811218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17044","last_updated":"2025-06-03T10:28:07Z","snapshot_observed_at":"2026-08-16T13:15:26.613305Z","submitted_at":"2024-09-25T15:54:29Z","title":"How to Connect Speech Foundation Models and Large Language Models? What Matters and What Does Not","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17044","snapshot_observed_at":"2026-08-10T22:18:01.816674Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.816674Z"},"links":{"cited_paper":"/paper/2409.17044","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:4dd19f6164630248ca54b72a69fa5474c7a2d7b8386ad2bbf935cf60ac012fd1","observation_id":"0b180781-470c-4722-afd9-cc36cdc536ee","resolution":{"observed_at":"2026-08-10T22:18:01.816674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.824647Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.824647Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:c4c31db329d9e9026e5abbfd232ca13ac576d6a5bac36d568c5d04de4842cf85","observation_id":"644d796c-cb4b-48ad-a834-32c75b6bac46","resolution":{"observed_at":"2026-08-10T22:18:01.824647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:03.255707Z","title":null,"venue":null,"work_id":"3045f7da-6258-468c-9d29-6a66ea78ccd3","year":2021},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.831175Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:b519d6fc4cc09d169e7ecfb06c8dfd0ae59dd671247b53b4ebd55ba0000e1359","observation_id":"50f35035-05eb-4bf6-8366-b0ebf5ae317a","resolution":{"observed_at":"2026-08-10T22:18:03.265035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00230","last_updated":"2023-09-30T02:27:45Z","snapshot_observed_at":"2026-08-16T14:56:19.891641Z","submitted_at":"2023-09-30T02:27:45Z","title":"SLM: Bridge the thin gap between speech and text foundation models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00230","snapshot_observed_at":"2026-08-10T22:18:01.839297Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.839297Z"},"links":{"cited_paper":"/paper/2310.00230","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:c074c59838332964719e51f8fcc597468b69795609fb6b9e981aae2baf12b51e","observation_id":"750102ff-069e-4043-b423-4e8dbce94f38","resolution":{"observed_at":"2026-08-10T22:18:01.839297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.08581","last_updated":"2017-06-12T13:54:12Z","snapshot_observed_at":"2026-08-14T21:10:07.380895Z","submitted_at":"2017-03-24T19:45:24Z","title":"Sequence-to-Sequence Models Can Directly Translate Foreign Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.08581","snapshot_observed_at":"2026-08-10T22:18:01.845871Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.845871Z"},"links":{"cited_paper":"/paper/1703.08581","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:09130502cdf2333c0f19a240a7e18527a478508924d97e888a3fa443f34eaa3e","observation_id":"0fccce70-8841-4921-8626-f3f84e2f7aa7","resolution":{"observed_at":"2026-08-10T22:18:01.845871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.851106Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.851106Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:fcc3524b28cda939ad4a25fad4c87de9998c5a2dae99fe5cce59c1ecff3229b6","observation_id":"393cfcda-844f-4c8b-8c67-a64940f5100e","resolution":{"observed_at":"2026-08-10T22:18:01.851106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.findings-naacl.91","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:18:01.929934Z","title":null,"venue":null,"work_id":"25c4b20e-936d-4710-8aee-8e3798fafdbb","year":2022},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.857584Z"},"links":{"citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:95523e47e7f4fd5f5806d40b928b3466c6632a34ba4994ff258e70065ddcf968","observation_id":"b3d35543-044d-4a02-98fb-3b5d6cea7074","resolution":{"observed_at":"2026-08-10T22:18:01.937062Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13523","last_updated":"2024-09-20T14:03:23Z","snapshot_observed_at":"2026-08-17T09:22:40.889673Z","submitted_at":"2024-09-20T14:03:23Z","title":"EMMeTT: Efficient Multimodal Machine Translation Training","version":1},"cited_work":{"arxiv_id":"2409.13523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13523","snapshot_observed_at":"2026-08-10T22:18:02.388573Z","title":"EMMeTT: Efficient Multimodal Machine Translation Training","venue":"cs.CL","work_id":"b2fb8744-6a1a-4d1f-9afe-cf659144b907","year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.863187Z"},"links":{"cited_paper":"/paper/2409.13523","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:f57fc2ac37a0b95118e5721b38963c1ace80087daac7ad03b68d7c58a18aadde","observation_id":"facb8f58-7fed-4995-8aa3-8c9320ef2013","resolution":{"observed_at":"2026-08-10T22:18:02.395738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02727","last_updated":"2021-02-22T20:17:07Z","snapshot_observed_at":"2026-08-18T13:46:08.613431Z","submitted_at":"2019-11-07T02:47:26Z","title":"Understanding Knowledge Distillation in Non-autoregressive Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02727","snapshot_observed_at":"2026-08-10T22:18:01.868319Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.868319Z"},"links":{"cited_paper":"/paper/1911.02727","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:2654121b1f6e8d8722184645bc2e43b43f6b1793fa81116cc265bac5209746df","observation_id":"88b24748-0963-43be-b838-277307e7072f","resolution":{"observed_at":"2026-08-10T22:18:01.868319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15712","last_updated":"2025-05-30T16:35:44Z","snapshot_observed_at":"2026-08-18T08:01:18.112437Z","submitted_at":"2024-12-20T09:33:31Z","title":"Contrastive Learning for Task-Independent SpeechLLM-Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15712","snapshot_observed_at":"2026-08-10T22:18:01.876712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T22:18:01.876712Z"},"links":{"cited_paper":"/paper/2412.15712","citing_paper":"/paper/2501.02370"},"observation_digest":"sha256:e84130bbda568960064bc140093b1f49cb0ec8d791333acd9e1009307836c68f","observation_id":"90e60d0c-b511-4a28-bb23-4298f8d61ce6","resolution":{"observed_at":"2026-08-10T22:18:01.876712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02370","last_updated":"2025-02-07T20:12:12Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T01:05:08.422924Z","submitted_at":"2025-01-04T20:14:16Z","title":"Prepending or Cross-Attention for Speech-to-Text? An Empirical Comparison"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":63,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2501.02370."}