{"as_of":"2026-08-17T22:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62d2264e43969445fb6d35c116eb87b274aca99340195bbb0557f8b5b9e4529c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:14:40.479138Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T23:34:52.249143Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T23:35:45.995297Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"cited_work":{"arxiv_id":"2501.09258","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09258","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Delayed fusion: Inte- grating large language models into first-pass decoding in end-to-end speech recognition","venue":null,"work_id":"c8131628-cf2f-4261-9529-59ac7943328f","year":2025},"citing_paper":{"arxiv_id":"2508.07285","last_updated":"2026-05-19T14:44:40Z","snapshot_observed_at":"2026-08-05T00:29:45.624756Z","submitted_at":"2025-08-10T10:46:14Z","title":"Non-Intrusive Automatic Speech Recognition Refinement: A Survey","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T23:34:52.249143Z"},"links":{"cited_paper":"/paper/2501.09258","citing_paper":"/paper/2508.07285"},"observation_digest":"sha256:29f9239a3553319dd88708b998717fd694cbd51fc389242cc144385d28219fe2","observation_id":"e6be21a0-8b88-4af3-b806-c34e4aef40ef","resolution":{"observed_at":"2026-05-21T23:35:46.000621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09258/citation-record","integrity":"/paper/2501.09258/integrity","json":"/paper/2501.09258/citation-record.json","paper":"/paper/2501.09258"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T20:14:40.327675Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.327675Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:a7fc3d3efd7ac3bd4976ce14c573c9070b3dd5b26063daa8118b6ee2a63b70b6","observation_id":"ceb45d18-e76e-44fb-a324-9327536b85fa","resolution":{"observed_at":"2026-08-10T20:14:40.327675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T20:14:40.331831Z","title":"LLaMA: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.331831Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:aeecd087cfe379af26ab8dc738094abc3ad7512ea311971a4c58c832131ffbf8","observation_id":"20130fd1-e4a7-4181-8025-979f0e4da704","resolution":{"observed_at":"2026-08-10T20:14:40.331831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.877229Z","title":"PaLM: Scal- ing language modeling with pathways,","venue":null,"work_id":"32fef9b0-5b6b-4033-b82c-843bab129695","year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.335939Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:eed26129882e24152b10d1641d74d790dccc1830626fb6468cb27677eee7d9d6","observation_id":"99093c50-b18e-41fa-9af3-e58604b1f0e9","resolution":{"observed_at":"2026-08-10T20:14:40.880922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T20:14:40.339567Z","title":"Mistral 7b,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.339567Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:56c0e54109b8987309843694af6f2c5032541b78eb18dcf3e2a1ed120f689a1b","observation_id":"9ee5b8f1-8d5b-40df-a711-23b45b313851","resolution":{"observed_at":"2026-08-10T20:14:40.339567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06196","snapshot_observed_at":"2026-08-10T20:14:40.343504Z","title":"Large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.343504Z"},"links":{"cited_paper":"/paper/2402.06196","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:df17860b235c09070f1fa5100b51596e480cb47ad8e689931515fbafd8dbb0cd","observation_id":"ae350a6e-17f5-401e-898c-8eb38820969f","resolution":{"observed_at":"2026-08-10T20:14:40.343504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.867408Z","title":"Attention is all you need,","venue":null,"work_id":"d77713a0-bee8-4329-9650-5a688101175f","year":2017},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.347829Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:cdd326871af7e0f0da8b9b73e6167b3d36704a810379308612a99e66944f700f","observation_id":"54d638c5-1294-46ef-a11f-f6d1d760894f","resolution":{"observed_at":"2026-08-10T20:14:40.870941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-10T20:14:40.351545Z","title":"AudioPaLM: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.351545Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:6122c1ebb401f257f8a72a8b8cbb014a373ce2e9a1b5b104bb590fbd00930706","observation_id":"010d43b0-666c-4a66-93c4-76aacc2ac254","resolution":{"observed_at":"2026-08-10T20:14:40.351545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.857713Z","title":"On decoder-only architecture for speech-to-text and large language model integration,","venue":null,"work_id":"41383a12-d618-4a6d-8547-a1cc453a7d94","year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.355327Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:6c939381a43055626c725a1c3b11a5b00910f85812faabc743d36362def366ba","observation_id":"cf021003-c347-4368-a5f1-31d336ea97fc","resolution":{"observed_at":"2026-08-10T20:14:40.861122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.847943Z","title":"SALSA: Speedy asr- llm synchronous aggregation,","venue":null,"work_id":"715f4067-5fb9-4e49-a725-4286bd80012f","year":2024},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.358507Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:01ef9d98d02ddee041f428d11874fb00ccd74e745c4b20138ba3b71785443f12","observation_id":"7958c125-d744-40fa-b396-3ea0af39571a","resolution":{"observed_at":"2026-08-10T20:14:40.851502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T20:14:40.361592Z","title":"LLaMA 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.361592Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:b1f75497e0444038406020a029047a6e7bbe4d9a54f0a71a6a071400b8985af1","observation_id":"ac33f144-1cd4-451e-aaee-127e012f67fd","resolution":{"observed_at":"2026-08-10T20:14:40.361592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.837112Z","title":"OpenLLaMA: An open reproduction of LLaMA,","venue":null,"work_id":"fda6d8f4-b3b6-49c1-9cc6-3e9f69949210","year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.365135Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:5e4500021a70c0134f125f2a26cdfcf3a29ec61d9b34b19ce08fb039a3f0da17","observation_id":"c5b3f3a5-4570-42e0-abb3-817f2e1b3b36","resolution":{"observed_at":"2026-08-10T20:14:40.841004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.375634Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.375634Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:2b3d77d7b6943bdb9ee1bad81a49f5621204b1ff1f5e5bef9201fc136a20d254","observation_id":"8b13a56f-cd01-4439-bf3e-f6f669b28b12","resolution":{"observed_at":"2026-08-10T20:14:40.375634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.821524Z","title":"Advances in joint CTC- attention based end-to-end speech recognition with a deep CNN encoder and RNN-LM,","venue":null,"work_id":"ca071a5e-23c3-4d0b-929c-80289fd6faed","year":2017},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.381124Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:8ff05a4efbb5e3cb0c1bf4152ddbcabe299eb6cb561890c137177c99d24aed91","observation_id":"a62dd26f-6dad-4c3b-b852-210403adb514","resolution":{"observed_at":"2026-08-10T20:14:40.824931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.812050Z","title":"A comparison of techniques for language model integration in encoder-decoder speech recognition,","venue":null,"work_id":"e09dcd0e-c214-4fbb-971e-effb854ba6ea","year":2018},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.385534Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:efa46afe8503a434429b74ad6a414588cb56c67fe90f355d97acbe0ffd7f5b4e","observation_id":"052cd3ea-c45d-4016-8643-b022b9b3e586","resolution":{"observed_at":"2026-08-10T20:14:40.815491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.802784Z","title":"On language model integration for RNN transducer based speech recognition,","venue":null,"work_id":"6c89178c-d6a6-477f-959a-43ea4e5634ec","year":2022},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.390768Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:d289abf431d12655d3227733015c224585ea5ad33055d01b469bec35b03a4af9","observation_id":"e1f286ac-f88c-4e53-8eb7-08701d5409c5","resolution":{"observed_at":"2026-08-10T20:14:40.806170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.791965Z","title":"Cold fusion: Training seq2seq models together with language models,","venue":null,"work_id":"f38a4b36-cb6d-4851-903f-4370d1179815","year":2018},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.395584Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:4323dcd90ddd7fb56bad4510ce7aa819a200cbe4a394ef6af842db727db242f0","observation_id":"d49e4993-79e6-4373-aa3f-fe896258c6e4","resolution":{"observed_at":"2026-08-10T20:14:40.796084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.781839Z","title":"Simple fusion: Return of the language model,","venue":null,"work_id":"f411563c-9a4e-4069-bc1e-548ab4972d54","year":2018},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.399797Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:c7cf6ca7d676d5fc964fb32241e17431b6c0f3489fa2f3c72951b929a63883d2","observation_id":"6cb89126-aa77-4ba9-9652-699142c53ee6","resolution":{"observed_at":"2026-08-10T20:14:40.785391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.771559Z","title":"Internal language model estimation for domain-adaptive end-to-end speech recognition,","venue":null,"work_id":"86248fa9-a586-49f3-9f94-70ee01198f50","year":2020},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.404015Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:0fe0f72446d4189dcab3ab8640a628f19f502d61b4d143b95f8e2adffa13b9b6","observation_id":"6b882b32-d7a7-406b-a87d-8eb22ddd1e68","resolution":{"observed_at":"2026-08-10T20:14:40.775109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.761536Z","title":"Efficient WFST-based one-pass decoding with on-the-fly hypothesis rescoring in extremely large vocabulary continuous speech recognition,","venue":null,"work_id":"cbb52783-1797-455c-aa69-b3eccf24e6ef","year":2007},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.408530Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:d08ccf5c57702c7f58ce90006774d28a2053aa944ec8d601fdc2843583a6139a","observation_id":"9205d564-b9b6-41e9-b415-93132448e8ab","resolution":{"observed_at":"2026-08-10T20:14:40.765198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.751989Z","title":"On-the-fly lattice rescoring for real- time automatic speech recognition,","venue":null,"work_id":"7eb9085c-4541-4224-b084-3ce4285f1808","year":2010},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.412911Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:f280e688d41115c08b4ad6f97c312d9ffc0fff67425a95cf1e9df0ea9776702e","observation_id":"3f8ebd03-a29e-4111-928d-1581ff0f7429","resolution":{"observed_at":"2026-08-10T20:14:40.755660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1408.2873","last_updated":"2014-12-08T20:21:52Z","snapshot_observed_at":"2026-08-14T23:23:21.779936Z","submitted_at":"2014-08-12T22:40:21Z","title":"First-Pass Large Vocabulary Continuous Speech Recognition using Bi-Directional Recurrent DNNs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1408.2873","snapshot_observed_at":"2026-08-10T20:14:40.417816Z","title":"First-pass large vocabulary continuous speech recognition using bi-directional recurrent DNNs,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.417816Z"},"links":{"cited_paper":"/paper/1408.2873","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:4675071d2d2077c114a731304cf9fb443b5f9397ec69d39eef4bdbbd8b03a01c","observation_id":"46843466-3788-44f9-be2e-ea833c9487ed","resolution":{"observed_at":"2026-08-10T20:14:40.417816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.742160Z","title":"End-to-end speech recognition with word-based RNN language models,","venue":null,"work_id":"7fec8b79-3273-46b3-9272-900fa9bf5aad","year":2018},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.422345Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:83789e9f2a671b561d5b0b94d439f3960f985cc4eddb7803cba81e0557c196c1","observation_id":"ce157d74-bc15-42f4-9652-f2720aac2553","resolution":{"observed_at":"2026-08-10T20:14:40.745913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11450","last_updated":"2019-10-24T23:00:12Z","snapshot_observed_at":"2026-08-13T23:04:25.844698Z","submitted_at":"2019-10-24T23:00:12Z","title":"An Empirical Study of Efficient ASR Rescoring with Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11450","snapshot_observed_at":"2026-08-10T20:14:40.426698Z","title":"An empirical study of efficient ASR rescoring with transformers,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.426698Z"},"links":{"cited_paper":"/paper/1910.11450","citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:2dc18ea3de4c691a7492bc450b736344bffd24ce970833c90c3a9cfb9cb217d7","observation_id":"2a9ad25d-eec5-4190-8fb0-69b96f9daaa1","resolution":{"observed_at":"2026-08-10T20:14:40.426698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.732103Z","title":"RescoreBERT: Discriminative speech recognition rescoring with BERT,","venue":null,"work_id":"54d5a299-dbb1-4dc3-baca-8d38e35a5854","year":2022},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.431373Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:d2d4eb4cb68d9757721ac28f6773543d8ad12a34207c3da6c57d4f38df7e1fc2","observation_id":"ecb3671a-1559-4edc-ad09-764810b02d3d","resolution":{"observed_at":"2026-08-10T20:14:40.735793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.722202Z","title":"Multilingual and fully non- autoregressive asr with large language model fusion: A comprehensive study,","venue":null,"work_id":"81e59d58-56a9-403a-87cd-256c7ca0b33b","year":2024},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.435288Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:3cd7812b9dd5bcc179d542e215cd805701f7ad5c483e51393f588ac43d1fea1c","observation_id":"cc2d67f4-6c5f-48ec-a9e6-06106f7c1dbe","resolution":{"observed_at":"2026-08-10T20:14:40.725708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.711810Z","title":"Effect and analysis of large-scale language model rescoring on competitive asr systems,","venue":null,"work_id":"7c18b235-937f-4bf0-9ba2-d1a5d8bf141f","year":2022},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.439730Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:2c92f99abf354983e80fbd56622eef18bf44c9934c9674a194b96e83eaf93836","observation_id":"af4aed5a-a2c4-4729-ba2f-638c92f03eb8","resolution":{"observed_at":"2026-08-10T20:14:40.715515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.701525Z","title":"Generative speech recognition error correction with large language models and task-activating prompting,","venue":null,"work_id":"dfc69658-0bed-45db-a5c4-71f31fd35544","year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.444205Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:e8e1ff77479788bfda35c537ead3a4d1946e9353439b0889dc7bddb1b462a6d8","observation_id":"85fef19a-77fe-4e6d-8b99-20d123946f71","resolution":{"observed_at":"2026-08-10T20:14:40.705186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.690683Z","title":"N-best T5: Robust asr error correction using multiple input hypotheses and constrained decoding space,","venue":null,"work_id":"4f30bbaa-4491-411a-ab0f-96a39b229d98","year":2023},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.448699Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:5a201f349175abcd9a2c63e721ea2030586090392ccec3f34b4c07cfdb0916ac","observation_id":"63a79d0c-5858-4003-9ffa-b19891611465","resolution":{"observed_at":"2026-08-10T20:14:40.695029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.679962Z","title":"Connectionist temporal classification: Labelling unsegmented sequence data with re- current neural networks,","venue":null,"work_id":"85bbb81d-068e-48b3-9626-ed419e8f5269","year":2006},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.453515Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:e5eb6ddd77309378bb8a291f603a8b77dd84aded072cf216e7dc6ee667e63e9b","observation_id":"aeb847bc-9731-40cb-ad4c-15e1660cebb4","resolution":{"observed_at":"2026-08-10T20:14:40.684026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.669163Z","title":"Sentencepiece: A simple and language inde- pendent subword tokenizer and detokenizer for neural text processing,","venue":null,"work_id":"009471b2-6344-4736-81e8-42ad283db978","year":2018},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.457785Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:79dd89cd40d627a86f8070f26ea7e86d2584788619d3b1406f3930332555b8b9","observation_id":"0def526d-cb22-41b6-8385-fe66b1bd841a","resolution":{"observed_at":"2026-08-10T20:14:40.673332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.657374Z","title":"Libriheavy: a 50,000 hours asr corpus with punctuation casing and context,","venue":null,"work_id":"cc0ec12a-3182-49d8-b4b1-f663c1e7bf2f","year":2024},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.461931Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:0961162fd5b7901875947016d21236f29339cc810f32cbb3670f6e831cfb9634","observation_id":"58a34bb1-39a7-4266-9281-9509c03ecb46","resolution":{"observed_at":"2026-08-10T20:14:40.661728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.647301Z","title":"Hybrid CTC/attention architecture for end-to-end speech recognition,","venue":null,"work_id":"0a1a0cb1-d5bc-4d52-944a-6beb778b2805","year":2017},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.466069Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:eaaf9a114bb8d38585e7d6ce4c1f6330829dff5da0b466129fd781a9f7bb55df","observation_id":"0b160e55-5ae5-4615-b017-5ff4a07f8018","resolution":{"observed_at":"2026-08-10T20:14:40.650686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.636714Z","title":"WeNet: Production oriented streaming and non- streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"c0ab3dcd-3a8f-4b65-a001-c836b1db345a","year":2021},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.471232Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:7f1cbc9403a268f34d10fd05ac42c758d3e42ed41f0807b09a53506071c0a76d","observation_id":"68e1319e-dce5-43d6-8a31-c0a252c192ad","resolution":{"observed_at":"2026-08-10T20:14:40.640600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.625927Z","title":"Joint CTC/attention decoding for end-to-end speech recognition,","venue":null,"work_id":"1e0dace4-292f-411b-98c5-3313a5f8492d","year":2017},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.475139Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:76f069475b7b9a45ff47f75ec2ab04d907d6246c5c839b58c3ca4695dd2a129f","observation_id":"8e3ed6b6-b44e-474b-8d64-ee72ccf96707","resolution":{"observed_at":"2026-08-10T20:14:40.629904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:14:40.613244Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":"60f09af5-8496-4ce1-9783-8acfd93fadc7","year":2012},"citing_paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:14:40.479138Z"},"links":{"citing_paper":"/paper/2501.09258"},"observation_digest":"sha256:45f0528de5e16993e64fe4fd9cadc19f1bb8e7ca24e6d1736b408d3875bce61a","observation_id":"34da047e-fe64-40bd-ab8e-2e48fa4f98c0","resolution":{"observed_at":"2026-08-10T20:14:40.618771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.09258","last_updated":"2025-01-16T03:01:50Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T20:04:28.416594Z","submitted_at":"2025-01-16T03:01:50Z","title":"Delayed Fusion: Integrating Large Language Models into First-Pass Decoding in End-to-end Speech Recognition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2501.09258."}