{"as_of":"2026-08-10T06:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2203072e88150550c8f6bdb94cde1352b9cad848d436ebd84fe2d48c959c0408","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:57.954776Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29279/citation-record","integrity":"/paper/2607.29279/integrity","json":"/paper/2607.29279/citation-record.json","paper":"/paper/2607.29279"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:53.900211Z","title":"arXiv preprint arXiv:2509.12508 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:53.900211Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:1b8e77cfd5d3a48de4593432956b50c86eef618566a10af131c3ce15c2ea223c","observation_id":"786023c1-079a-4bf8-82c1-d41f5b28afd8","resolution":{"observed_at":"2026-08-03T10:13:53.900211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:53.962467Z","title":"In: Proceedings of the Twelfth Language Resources and Evaluation Conference","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:53.962467Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:01f690a962a8d25d4c99df2c3bf59502bfec1e9097ca73d08082799b38c2cd82","observation_id":"98d73dab-bdee-4925-b285-723f707ab2c4","resolution":{"observed_at":"2026-08-03T10:13:53.962467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:54.044695Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.044695Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:89dd78ae41e172795543ddb1643f444c044f04507b49bf1fde0f5fbf2db793b5","observation_id":"59897fb3-9159-4e10-b6ff-cd66f47b02d4","resolution":{"observed_at":"2026-08-03T10:13:54.044695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:54.189749Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.189749Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:6d54f79d3099d6c59349b2afee0fc8a04add7a196b13c4e6ca4daf220ca341e1","observation_id":"f105ed3b-93ca-4826-b8d7-e8988352e9c9","resolution":{"observed_at":"2026-08-03T10:13:54.189749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-03T10:13:54.253318Z","title":"arXiv preprint arXiv:2407.04675 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.253318Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:388afeb1bf8f15a2c280976e52a95a905ce3bd00162423b7646bf5c0e2965125","observation_id":"7d9304c1-3dee-415d-92b3-b42649a97cf5","resolution":{"observed_at":"2026-08-03T10:13:54.253318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00747","last_updated":"2023-07-11T17:07:19Z","snapshot_observed_at":"2026-08-07T11:26:26.674534Z","submitted_at":"2023-03-01T18:59:13Z","title":"WhisperX: Time-Accurate Speech Transcription of Long-Form Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00747","snapshot_observed_at":"2026-08-03T10:13:54.327892Z","title":"arXiv preprint arXiv:2303.00747 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.327892Z"},"links":{"cited_paper":"/paper/2303.00747","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:d0eda01fa585f153f4617a2aca37c58412b28d27e58c0112b5475682efa0b542","observation_id":"60aa5429-51d5-4dd8-a379-f1250ea58b3f","resolution":{"observed_at":"2026-08-03T10:13:54.327892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:54.405095Z","title":"In: 2017 20th Conference of the Oriental Chapter of the International Coordinating Committee on Speech Databases and Speech I/O Systems and Assessment","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.405095Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:5c659e6da22c0a3351fd71ec0e52b9a6444eb2fe14f07f1506ef5417ed0c4b28","observation_id":"6b018eb8-dd4f-450c-8ef0-256b36962a39","resolution":{"observed_at":"2026-08-03T10:13:54.405095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-03T10:13:54.567049Z","title":"arXiv preprint arXiv:2401.10774 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.567049Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:99a84a4c867b47faa05981477c2494ff452180fe8c5faaf01c0c74c4ef93d4ba","observation_id":"a873db63-7423-4755-a66c-75739bc9399d","resolution":{"observed_at":"2026-08-03T10:13:54.567049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-08-08T05:51:42.766537Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-08-03T10:13:54.677464Z","title":"arXiv preprint arXiv:1508.01211 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.677464Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:940c142e819d3ace550a7282c2f8b1e540aba439f46eb9df2dbfee4ad8bfc0f6","observation_id":"c4d5d563-3613-49ad-aad0-996cf83555a0","resolution":{"observed_at":"2026-08-03T10:13:54.677464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-03T10:13:54.841372Z","title":"arXiv preprint arXiv:2302.01318 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.841372Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:1136e76e4503d08fcf60314a73ec72f31b704e80cfe706ffa085a87049b72a18","observation_id":"8c35b0d7-c2cf-44c1-93b4-09c538a9986a","resolution":{"observed_at":"2026-08-03T10:13:54.841372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-08-03T10:13:54.959703Z","title":"arXiv preprint arXiv:2205.12446 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:54.959703Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:b07f37e73f1635cd3093501cd81edf175a449aca64a399bce7949871994d92f9","observation_id":"0a00891e-d3f5-4e73-b27d-8578017b231d","resolution":{"observed_at":"2026-08-03T10:13:54.959703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:55.143015Z","title":"arXiv preprint arXiv:2511.00850 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.143015Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:168683f873e045c778203c58fa44eee64f24bc333a4b739cfd6eec8828a00df5","observation_id":"b914f1c1-138d-43ea-9bc0-1c88ea8f8d0b","resolution":{"observed_at":"2026-08-03T10:13:55.143015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-10T01:59:34.520388Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-03T10:13:55.256063Z","title":"arXiv preprint arXiv:1808.10583 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.256063Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:869c6b4e9dc12c24df0668e33ff01d57db5895894860320b04d105d862ef3313","observation_id":"84590f14-97e8-4627-96c8-0976a52559ce","resolution":{"observed_at":"2026-08-03T10:13:55.256063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:55.344559Z","title":"In: 1997 IEEE Workshop on Automatic Speech Recognition and Understanding Proceedings","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.344559Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:abc532ec74d57873503d7c6fcb940858340d18687900c1ed20e666e28cc15e24","observation_id":"8a79d292-1f8a-4733-bdfd-72157ec3dde8","resolution":{"observed_at":"2026-08-03T10:13:55.344559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-03T10:13:55.501150Z","title":"arXiv preprint arXiv:2404.19737 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.501150Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:09b8e205d99181a9c54fbcc7ed99af0a6f87477610ea3b2dbd9df9941fd08bbf","observation_id":"a699f2ed-2560-42c0-be04-d8e298569471","resolution":{"observed_at":"2026-08-03T10:13:55.501150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:55.684968Z","title":"In: Supervised sequence labelling with recurrent neural networks, pp","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.684968Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:18af306aa25c432c2b701a17556373fe7ee6960ce55d97ccc90ec9b30a77fbec","observation_id":"701c2852-13e5-40de-b600-afa692b17e6a","resolution":{"observed_at":"2026-08-03T10:13:55.684968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-03T10:13:55.806367Z","title":"arXiv preprint arXiv:1211.3711 (2012)","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.806367Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:86953cd19f7124999df52f8a651216dadc0c4811a896943ea024e67b7aac64cd","observation_id":"e98b20d4-e12e-451d-af7a-6cfb656d79e5","resolution":{"observed_at":"2026-08-03T10:13:55.806367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:55.896842Z","title":"arXiv preprint arXiv:2602.10604 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.896842Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:e2b3ad6b9e7d30cd9a3d17910c7b2255294a660ce56ee26a1ac664327238a0e0","observation_id":"2b3adb49-ff95-4ec7-a6e3-4ee3ce5b227e","resolution":{"observed_at":"2026-08-03T10:13:55.896842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:55.951331Z","title":"In: ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:55.951331Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:fbc01ae1c5f75a2c5f66af6885008926c5607b0b2584115b7416b4b54a843623","observation_id":"7fc80d42-bd14-4677-96a1-0555c731bc76","resolution":{"observed_at":"2026-08-03T10:13:55.951331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.028066Z","title":"PMLR (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.028066Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:26bfbeb841807f3e468c39feb5b3f66823c97a128ce90518f1635e301d40cef5","observation_id":"16ed9af0-bddf-4445-bedd-e80a5bb5dabd","resolution":{"observed_at":"2026-08-03T10:13:56.028066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-03T10:13:56.110991Z","title":"arXiv preprint arXiv:2605.23463 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.110991Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:682b0cb92719fb5720372acea7a819f95609509892dfcde34c9b523904716350","observation_id":"a05dba3a-3f4d-45fe-ad13-fa4c033e29f2","resolution":{"observed_at":"2026-08-03T10:13:56.110991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12034","snapshot_observed_at":"2026-08-03T10:13:56.212641Z","title":"arXiv preprint arXiv:2605.12034 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.212641Z"},"links":{"cited_paper":"/paper/2605.12034","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:f779a334b8441f426563405c79554aed12d3df419013211adb5732d3a7bd7678","observation_id":"fec2c2ba-554f-41c4-8d0b-b1181f731ba6","resolution":{"observed_at":"2026-08-03T10:13:56.212641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.287599Z","title":"arXiv preprint arXiv:2509.24310 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.287599Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:2631f70d0e04ba18ef7b783a3ae039f2e018b4edab060d5dc3d451e17883e636","observation_id":"e6ea5e0b-160c-4d36-be00-ea350751c1dd","resolution":{"observed_at":"2026-08-03T10:13:56.287599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.371783Z","title":"Multimedia Tools and Applications80(6), 9411–9457 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.371783Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:55342e93aa670b4322e9e020621c71222d1c3c93ecbc40d2a4122ce8cf03aa2d","observation_id":"e9eafcfa-2543-4c00-8956-5556515a8dc7","resolution":{"observed_at":"2026-08-03T10:13:56.371783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.439971Z","title":"In: 2015 IEEE International Conference on Acoustics, Speech and Signal Processing","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.439971Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:29a56a625b29756d012c793fb9eea91587362876ae903f79bba1a9f771088bc4","observation_id":"4294a865-6f85-425d-8e02-7c88ce2fa08b","resolution":{"observed_at":"2026-08-03T10:13:56.439971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.559132Z","title":"In: Interspeech 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.559132Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:ec82dc789142c4ad6054faa34a12518053783c8185e0de194fba62a7cabdc838","observation_id":"670a9bb4-64f1-483b-8ea2-8f39f00f5179","resolution":{"observed_at":"2026-08-03T10:13:56.559132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.661673Z","title":"arXiv preprint arXiv:2601.18184 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.661673Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:f301c2e392b67047a2e3acc88d9308b94d307c0a0799c4c9eb3874c403e19407","observation_id":"85426615-17cb-45b6-863e-7499fc858af1","resolution":{"observed_at":"2026-08-03T10:13:56.661673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.747587Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.747587Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:a13d3dacac148180c549bc749ce4413571c941a56bcd59129d80bfd9f24955d8","observation_id":"34b7b98c-a437-43b3-9e85-a862db828b91","resolution":{"observed_at":"2026-08-03T10:13:56.747587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-03T10:13:56.837223Z","title":"arXiv preprint arXiv:2601.21337 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.837223Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:0f5296b59f21a45020c26b4bdd5986aca9ae1cc977e182d2968b1bf57c25af31","observation_id":"49398783-16d2-4f38-8552-36d00e3cdcfd","resolution":{"observed_at":"2026-08-03T10:13:56.837223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:56.948109Z","title":"arXiv preprint arXiv:2511.15848 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.948109Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:12d1ae3f2bb9450b0a3beca412492e74db4ca830088d04bbc50007ca6e81741e","observation_id":"96b7d5c6-40bd-4372-b052-9a4518c7b4ba","resolution":{"observed_at":"2026-08-03T10:13:56.948109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-03T10:13:57.074975Z","title":"arXiv preprint arXiv:2507.16632 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.074975Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:22b95d80e4167157bd29107625147473ffe820da4498cfefecd191494356d3e2","observation_id":"fb3eaa16-e7e1-43db-a0ca-c7e1b0191f4c","resolution":{"observed_at":"2026-08-03T10:13:57.074975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09592","last_updated":"2026-05-10T15:21:35Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:50:59Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.09592","snapshot_observed_at":"2026-08-03T10:13:57.190594Z","title":"arXiv preprint arXiv:2510.09592 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.190594Z"},"links":{"cited_paper":"/paper/2510.09592","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:a0fefc12ae9632c3108a88470028ee953e5c42a4a5755c06d4220288aa0f8054","observation_id":"f65dfae5-4eca-46bc-98c1-0ede1ccce1c9","resolution":{"observed_at":"2026-08-03T10:13:57.190594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-03T10:13:57.308232Z","title":"arXiv preprint arXiv:2509.17765 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.308232Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:db361b164e32ff07664080b2b56dca82172825b85b5049998ec3ff7aea7c131d","observation_id":"e66aebf7-654d-4632-9ae6-b30d514d25ac","resolution":{"observed_at":"2026-08-03T10:13:57.308232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:57.421541Z","title":"In: ICASSP 2023-2023 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.421541Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:3c845a5fda91228d4231a4b856bf22aa57a08ef6e2779d7db63dabb2d8ed31a4","observation_id":"41173a3e-492f-4ecf-8dd3-bf59f3429dba","resolution":{"observed_at":"2026-08-03T10:13:57.421541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:57.509325Z","title":"In: Proc","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.509325Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:0d7376c372cceaaa612051292928173bb491fff1e5538cd0974caeababc0be82","observation_id":"c37169ab-571b-462d-9532-9e62f73f0700","resolution":{"observed_at":"2026-08-03T10:13:57.509325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:57.569911Z","title":"In: ICASSP 2022 - 2022 IEEE International Conference on Acoustics, Speech and Signal Processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.569911Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:84539bed0e9c7e834d280cc478ca34225207d9f76daec81d2848b670a6000eda","observation_id":"68e690a5-c5a6-4dc7-9bad-08c34e9a21f5","resolution":{"observed_at":"2026-08-03T10:13:57.569911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20755","snapshot_observed_at":"2026-08-03T10:13:57.633052Z","title":"arXiv preprint arXiv:2605.20755 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.633052Z"},"links":{"cited_paper":"/paper/2605.20755","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:6f29d826cb9233db06f070fbe7c3b7710c89dfbcee60031cf58433215e511c34","observation_id":"e5a96d3b-4301-4639-8848-e9d03eedb21f","resolution":{"observed_at":"2026-08-03T10:13:57.633052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17076","snapshot_observed_at":"2026-08-03T10:13:57.724078Z","title":"arXiv preprint arXiv:2505.17076 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.724078Z"},"links":{"cited_paper":"/paper/2505.17076","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:a1634ab720bacfa8eb74602b62f921dfbc8a0be1cf51921c3387e29afa34ffb0","observation_id":"d6e5ce31-033b-4fde-86cd-ac72e05ad0a5","resolution":{"observed_at":"2026-08-03T10:13:57.724078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29209","last_updated":"2026-05-28T00:42:45Z","snapshot_observed_at":"2026-08-03T17:19:06.252921Z","submitted_at":"2026-05-28T00:42:45Z","title":"The WER Trap: Shattering the Illusion of Unified Tokens in Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29209","snapshot_observed_at":"2026-08-03T10:13:57.787394Z","title":"arXiv preprint arXiv:2605.29209 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.787394Z"},"links":{"cited_paper":"/paper/2605.29209","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:ea86fd4f513a7977152c551c8a93a5bf401d82b8968d671e4375a9458fc09127","observation_id":"92418081-62ad-4080-9924-bd5911203b0b","resolution":{"observed_at":"2026-08-03T10:13:57.787394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T10:13:57.856488Z","title":"IEEE Transactions on Audio, Speech and Language Processing (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.856488Z"},"links":{"citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:a61cdf7b48a57f6b02d9ee9a69eeb85c84f33fa88e7bae98ac5c24f53481820b","observation_id":"3b207db3-9e4f-48f1-b3d8-f17750f315d2","resolution":{"observed_at":"2026-08-03T10:13:57.856488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25719","last_updated":"2026-05-31T23:35:54Z","snapshot_observed_at":"2026-08-03T00:45:36.849248Z","submitted_at":"2026-04-28T14:44:30Z","title":"Step-Audio-R1.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25719","snapshot_observed_at":"2026-08-03T10:13:57.954776Z","title":"arXiv preprint arXiv:2604.25719 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.954776Z"},"links":{"cited_paper":"/paper/2604.25719","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:3227c19bd2da6e294939c9135df1634a8d746101264e8eaca4da027a3f88e094","observation_id":"cad70a16-691f-4939-ab2e-c04847e2c8b7","resolution":{"observed_at":"2026-08-03T10:13:57.954776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.29279."}