{"as_of":"2026-08-14T02:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d5af32e85bf45791c62288405642a0ab5e11bad09a8b23f33b74507282103c0","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:46:49.282451Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T00:56:43.991936Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T07:27:44.920929Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:ed2f6ec4fd846ef853222610fc9f38d3ed12b7acf8ad17046ac7155c57cfcf02","observation_id":"5e0eb325-70d6-4597-a064-93b3bef5b1ae","resolution":{"observed_at":"2026-05-18T16:31:37.222863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2606.10368","last_updated":"2026-06-09T03:27:30Z","snapshot_observed_at":"2026-08-13T00:18:02.092107Z","submitted_at":"2026-06-09T03:27:30Z","title":"Speech Meets ELF: Audio Conditional Continuous-Target Diffusion for Speech Recognition and Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T12:04:50.483329Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2606.10368"},"observation_digest":"sha256:baa9cd0a4a124d2c68d486546b190c35e2da59a8ab7a1150c3e6c4f2f1d6922a","observation_id":"3667a07c-94e2-4be2-8936-8432bcc774f9","resolution":{"observed_at":"2026-07-03T07:27:44.922554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2508.17863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17863","snapshot_observed_at":"2026-07-03T07:27:44.920929Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spo- ken Language Understanding in SpeechLLMs","venue":null,"work_id":"955ccaa6-1a25-4412-b5ca-1a601446917d","year":2025},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2508.17863","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:3215e0b698a96fb4f7d4115bd49b01c5590492e645aa132ed3c8ef2e70e234e0","observation_id":"89a5f7bf-cfe4-4d3e-be39-55c2f5ca66a6","resolution":{"observed_at":"2026-06-29T01:02:56.248185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17863/citation-record","integrity":"/paper/2508.17863/integrity","json":"/paper/2508.17863/citation-record.json","paper":"/paper/2508.17863"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-05T16:46:47.064133Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.064133Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:6b3248d451f97907f7f2b23f6b72fa164d20f69ec260a0ace383245749c99403","observation_id":"a9b52bf9-b6e4-40c0-b305-81f589a83a6f","resolution":{"observed_at":"2026-08-05T16:46:47.064133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T16:46:47.124721Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.124721Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:2f9259bedc445a2bb8668187c9569212efbc58618ea8d3480523f0e773b21c57","observation_id":"3aa58d23-2c8b-4667-9f07-2639666c394f","resolution":{"observed_at":"2026-08-05T16:46:47.124721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13205","last_updated":"2020-11-26T09:58:20Z","snapshot_observed_at":"2026-08-08T19:41:07.665525Z","submitted_at":"2020-11-26T09:58:20Z","title":"SLURP: A Spoken Language Understanding Resource Package","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13205","snapshot_observed_at":"2026-08-05T16:46:47.223367Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.223367Z"},"links":{"cited_paper":"/paper/2011.13205","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:95fb50a3e79942cdbbc4b41c106b8b4a6684b35b22e2cb7060a664b11a9e713d","observation_id":"555c79fd-572b-4e21-916f-edbf18b4c574","resolution":{"observed_at":"2026-08-05T16:46:47.223367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.954848Z","title":null,"venue":null,"work_id":"97ae148c-a163-4655-9a33-e93ec49bd7db","year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.328362Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:6f2ac14632e62670820d132c9c21c3b5a18b7e04c593f06cdcb5e7cde13753a7","observation_id":"ef17f421-9602-4c3a-9911-b47eb4b02ad4","resolution":{"observed_at":"2026-08-05T16:46:49.957548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.946805Z","title":null,"venue":null,"work_id":"ef9b5dc4-a9db-41f8-a660-7ad2e11491cf","year":2008},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.390216Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:f49a5a5923d9c80de825af56eece595072cd1e38b2f82e628e2cc260ff6ac8a3","observation_id":"21e7f332-5c39-4404-8cd5-2d104bc89f32","resolution":{"observed_at":"2026-08-05T16:46:49.949765Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:47.487403Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.487403Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:e75d28473347d19a444292f872db47539ad787b062965e34b1c22c05b5e896cd","observation_id":"aeff3fc1-8532-4454-a968-25da03344a4f","resolution":{"observed_at":"2026-08-05T16:46:47.487403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.939115Z","title":null,"venue":null,"work_id":"827fb438-e4a3-44dd-b01f-c85ef2e5f326","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.555373Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:68b34035ce21d1354220df3e52d13124c661c781be680b4935f7814beb9d737e","observation_id":"63cde880-590b-4f8a-a196-9b77100c7de0","resolution":{"observed_at":"2026-08-05T16:46:49.941858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-13T19:04:39.932284Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T16:46:47.691984Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.691984Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:0c42e0bc076324eef7e28f8530eb2f0e42cb46605650e7694507a0fc4d3701b2","observation_id":"59d58ead-f7e1-4f16-a889-aa6095d78d70","resolution":{"observed_at":"2026-08-05T16:46:47.691984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-13T05:55:03.054769Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-05T16:46:47.765382Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.765382Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:37b26cdf87e1bf0078b1461f8662cda78d9f3b9a3783ee84abff4761c4636cce","observation_id":"8c6a3ded-de9b-4d0d-8255-efc9e2389adb","resolution":{"observed_at":"2026-08-05T16:46:47.765382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.931641Z","title":null,"venue":null,"work_id":"f3ccc822-b672-4372-8450-5dda7f7c5e3e","year":2022},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.860324Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:8c2412d9c30457a02de73b2868002fbdb6313f7c9c08ca0d9616156a6bfc5e70","observation_id":"52db9ce8-41ec-454d-8e0a-076ed64207bc","resolution":{"observed_at":"2026-08-05T16:46:49.934533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-05T16:46:47.924933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:47.924933Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:1088c2b7a99d82d862ac8f9c28c7f643841cf173b6c276da4b074a447e61baed","observation_id":"273e77fb-f566-4c2a-bd53-c60e976523b4","resolution":{"observed_at":"2026-08-05T16:46:47.924933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T16:46:48.021893Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.021893Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:06d53ee9ef726f5240360e72d9d183dd3c7a6f869ee088ee8a450d0f76d9520b","observation_id":"251c40b2-4f2c-478d-b659-c45cef6a6c6c","resolution":{"observed_at":"2026-08-05T16:46:48.021893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-13T04:26:19.215530Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T16:46:48.070568Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.070568Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:28961bde842bf4516845158d50bfb3415852c3d31263c8b0d69382d50ed7861e","observation_id":"b90e7ae5-32b0-4904-aa3f-5e5b23cb3264","resolution":{"observed_at":"2026-08-05T16:46:48.070568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T16:46:48.093307Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.093307Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:19220addb65c4bc52870aec61aa938ee4fad5e93b4078de472c384b7b53c83fc","observation_id":"25d5a620-79c0-4275-94f5-f82068149967","resolution":{"observed_at":"2026-08-05T16:46:48.093307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05547","last_updated":"2024-06-08T18:34:28Z","snapshot_observed_at":"2026-08-12T23:47:15.381088Z","submitted_at":"2024-06-08T18:34:28Z","title":"Exploring the Benefits of Tokenization of Discrete Acoustic Units","version":1},"cited_work":{"arxiv_id":"2406.05547","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05547","snapshot_observed_at":"2026-08-05T16:46:49.649670Z","title":"Exploring the Benefits of Tokenization of Discrete Acoustic Units","venue":"cs.SD","work_id":"6d6cb7d3-cdf4-493b-a28c-5eef8108c3cd","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.202777Z"},"links":{"cited_paper":"/paper/2406.05547","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:3ad48c7e056db6cdde1feb584f5265c89f8667310bc509fcd4e38f76ddbcfb43","observation_id":"53e548ca-4d3d-48ad-8491-64055f7569f8","resolution":{"observed_at":"2026-08-05T16:46:49.652664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T16:46:48.356620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.356620Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:b4ff08b23ac4892f15c94b3cb3c30e3c5837090f8bf5292e3dfa00b1da205bff","observation_id":"f513f72a-db5f-4106-bc4c-05b4d09d7087","resolution":{"observed_at":"2026-08-05T16:46:48.356620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.923505Z","title":null,"venue":null,"work_id":"3894a677-bf6d-489e-b418-dca1e1d913bc","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.486899Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:939e818754c991a7a35f9db01971a83d038307a215cf25b6752444da8b4fb6cb","observation_id":"2bba73a3-5426-4bf6-bedb-0330b9655176","resolution":{"observed_at":"2026-08-05T16:46:49.926577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.915817Z","title":null,"venue":null,"work_id":"529e131e-2c8e-4f32-8af0-6d7ccfe4a853","year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.635372Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:4984604a0d80b651c8b2de5463af126fa1534a9032ddfa32530bdfd75de3b046","observation_id":"60e763a5-eb26-4df5-868b-81e21fab4b52","resolution":{"observed_at":"2026-08-05T16:46:49.918359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-13T11:39:40.594833Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-05T16:46:48.796047Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.796047Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:c8d23e3f7da3808e5eae8d9b1e0a5f9e28ead45dcc06145297615cc236f740f4","observation_id":"003dd5a5-a870-433e-8397-f892f8ba0cb1","resolution":{"observed_at":"2026-08-05T16:46:48.796047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.906335Z","title":null,"venue":null,"work_id":"f387d3f5-6760-4ee7-aee8-0caae4ca569b","year":2021},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.963009Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:bacb9fd37ecb4fc8a04701a42514b7c5255ea32a456a693fc4ef5e9dd34b78b5","observation_id":"9ea639e1-8de5-4d71-86c4-f09baeca2449","resolution":{"observed_at":"2026-08-05T16:46:49.909209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T16:46:49.182080Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.182080Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:c5e3968fcbe150fa03bf76ec1791b5fad02627d5460759d68dd4e5a88fa3cd6d","observation_id":"8e34093a-3e8c-481c-93d0-767033c9d995","resolution":{"observed_at":"2026-08-05T16:46:49.182080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-12T20:06:41.245137Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T16:46:49.184979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.184979Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:538f634fbe413a8ad6f722a580dd6abdba34165b7e12044850ac8317c6abd875","observation_id":"5288e3c4-2220-4f74-bd8a-ccf2e787a69d","resolution":{"observed_at":"2026-08-05T16:46:49.184979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-12T22:55:11.320450Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-05T16:46:49.187588Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.187588Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:37d704d0f09e3d84584b72dbb9ac4abc9ed3846bdd287d92278522a6d795bcf5","observation_id":"127383d8-3888-406f-bf51-3a37cc4d4d52","resolution":{"observed_at":"2026-08-05T16:46:49.187588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.190729Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.190729Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:a9d737710e6c24e7b1013e3e5bca40ebee79952e9456f8a489ffc59aa36b10df","observation_id":"950e6ffd-d212-4326-9577-37c7267beefe","resolution":{"observed_at":"2026-08-05T16:46:49.190729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17081","last_updated":"2025-03-31T13:57:49Z","snapshot_observed_at":"2026-08-12T22:17:30.907669Z","submitted_at":"2024-10-22T15:02:37Z","title":"Continuous Speech Tokenizer in Text To Speech","version":2},"cited_work":{"arxiv_id":"2410.17081","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.17081","snapshot_observed_at":"2026-08-05T16:46:49.599008Z","title":"Continuous Speech Tokenizer in Text To Speech","venue":"cs.SD","work_id":"26c8fc6d-715e-4fa5-8cac-05275656252d","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.193445Z"},"links":{"cited_paper":"/paper/2410.17081","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:bd28633cd1bcfd0cfbebada0060577a42aab01c52ecbcb4f4d5ef2e290f8516f","observation_id":"8a3261b7-ad91-47e5-9be0-886189330964","resolution":{"observed_at":"2026-08-05T16:46:49.602331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-13T04:19:27.486516Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-05T16:46:49.196106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.196106Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:3c4a958c08dbf25773e15b9a9effc8795bc5b121a08a17914f5530cbd4c7045c","observation_id":"ca7456a1-cfec-42dc-8ed9-fd7c83588c02","resolution":{"observed_at":"2026-08-05T16:46:49.196106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12428","last_updated":"2024-10-03T05:17:25Z","snapshot_observed_at":"2026-08-12T23:40:16.711757Z","submitted_at":"2024-06-18T09:23:54Z","title":"PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems","version":2},"cited_work":{"arxiv_id":"2406.12428","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12428","snapshot_observed_at":"2026-08-05T16:46:49.577237Z","title":"PSLM: Parallel Generation of Text and Speech with LLMs for Low-Latency Spoken Dialogue Systems","venue":"cs.CL","work_id":"737937ae-16b2-42ea-8c4e-62442095a738","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.199048Z"},"links":{"cited_paper":"/paper/2406.12428","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:368c958133c960e012ec666f276bc3f372aff94bfffd227375c30d2f2060c90a","observation_id":"288f89b5-1b4f-4b77-a6be-f36784bd7c75","resolution":{"observed_at":"2026-08-05T16:46:49.581631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10735","last_updated":"2024-06-15T20:43:07Z","snapshot_observed_at":"2026-08-12T23:41:58.405020Z","submitted_at":"2024-06-15T20:43:07Z","title":"How Should We Extract Discrete Audio Tokens from Self-Supervised Models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10735","snapshot_observed_at":"2026-08-05T16:46:49.201803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.201803Z"},"links":{"cited_paper":"/paper/2406.10735","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:2a9b4b84209475fe82fb40bba72df0b5b86316847c45624e4674bb145a710688","observation_id":"7dcb80e2-5104-49ea-bc20-9dc7a316d8d6","resolution":{"observed_at":"2026-08-05T16:46:49.201803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.897694Z","title":null,"venue":null,"work_id":"55b163d9-a1ba-4b6a-b094-e961bf2823ef","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.204517Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:f8ae973f7db486372dffceada0dd4a309c5275f498ee192aec6c36c571b543a6","observation_id":"36df5c38-9ff3-478f-b9d6-01f7a273e5bc","resolution":{"observed_at":"2026-08-05T16:46:49.900264Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.889444Z","title":null,"venue":null,"work_id":"dba4eaab-da1d-468e-b35a-7bec92494de0","year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.206910Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:417fe7388e164612473fb19da1945d7e8ada3f554b4d6919e43ecd9f5d090f9f","observation_id":"bd0e828b-c896-4ba8-9bdb-1f81344a04c7","resolution":{"observed_at":"2026-08-05T16:46:49.892093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.880783Z","title":null,"venue":null,"work_id":"349ba4a9-cfb7-4313-8458-b029f99bb5ce","year":2015},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.209410Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:b8ad5e4cdc56f7059fbdc0e636001dfb5727c0330fb0d1ebdbb3c7e7deca22f0","observation_id":"6296b8dd-7b47-4047-8c23-5c862a9ecd22","resolution":{"observed_at":"2026-08-05T16:46:49.883742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.211813Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.211813Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:a8083e8b3d941c9f0ba34761cf9a55f9704f39ff544532b5e9eaf925bb8caa76","observation_id":"49a1d482-f3a4-417d-8dde-03d944f1e11b","resolution":{"observed_at":"2026-08-05T16:46:49.211813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.872880Z","title":null,"venue":null,"work_id":"4f78b997-9f0b-44da-b487-c9aaa135429e","year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.214337Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:20e7e9342de5bc684bfbe4a8eb5319c0b23a40a91a933847eb2f0f0803cc5fe9","observation_id":"e55f726f-0bc6-463b-b818-abeb078d964f","resolution":{"observed_at":"2026-08-05T16:46:49.875522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T16:46:49.216718Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.216718Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:460e892d73416e1a7281b049cc3b8125f77f5cf5f07139231d2b01c5c51a31d5","observation_id":"6b3b7ae4-e59d-4345-a001-4097b9b36a86","resolution":{"observed_at":"2026-08-05T16:46:49.216718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.864501Z","title":null,"venue":null,"work_id":"a67b9b2c-14c9-4012-8535-b05dee3cd7ae","year":2022},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.220533Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:86184dee3cb8f46e349c23146ba19cdd07b9fecd419b16b9775ccdcaff3ecd89","observation_id":"871b63f0-a24a-474b-8214-bd978d1f0d83","resolution":{"observed_at":"2026-08-05T16:46:49.867337Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09345","last_updated":"2024-06-13T17:28:13Z","snapshot_observed_at":"2026-08-12T23:43:21.365417Z","submitted_at":"2024-06-13T17:28:13Z","title":"DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding","version":1},"cited_work":{"arxiv_id":"2406.09345","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.09345","snapshot_observed_at":"2026-08-05T16:46:49.438173Z","title":"DiscreteSLU: A Large Language Model with Self-Supervised Discrete Speech Units for Spoken Language Understanding","venue":"cs.CL","work_id":"0be183bb-12f3-408f-a163-50d02531a0af","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.223732Z"},"links":{"cited_paper":"/paper/2406.09345","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:87a47c861436769fba9266eab7f1622e07e712291b18d78042aa4b21a1b83091","observation_id":"c582b0e4-44dc-4def-87c9-84d8c2620ae5","resolution":{"observed_at":"2026-08-05T16:46:49.441586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-05T16:46:49.226321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.226321Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:deddad6e4f23c345b7ac1df3c61cd309a7c35f40dd9bc07cad6cd2b8c834e877","observation_id":"4073ece4-78b8-40ac-baa2-e52fee4a7071","resolution":{"observed_at":"2026-08-05T16:46:49.226321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.855327Z","title":null,"venue":null,"work_id":"3a3590bd-5653-483e-ac60-5e8106684b3a","year":2022},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.229228Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:db783b90269fca36c5e5ce42f68ac9a273c0716fe138503d3a80b065034fc9a7","observation_id":"7a2eb8ed-93bf-4b58-9b78-14df767b8381","resolution":{"observed_at":"2026-08-05T16:46:49.858172Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.847078Z","title":null,"venue":null,"work_id":"35c4d8d6-b7da-487b-a222-233ae4033cc6","year":2016},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.231950Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:5c6f57c42f94fc2aa5becaa0570563e3e71c4d3c35c9a0563f5ddd30a011ffaa","observation_id":"58daee93-3456-4c1e-a19a-d8a94f8dfe07","resolution":{"observed_at":"2026-08-05T16:46:49.849882Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-08-13T10:22:11.831046Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-05T16:46:49.234700Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.234700Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:cb6029c778ced14dcd34a33d5aebc0aef807355570112f32216b8ba4fa6d3408","observation_id":"c278616e-00d3-432b-aeb3-9c587e7b02bb","resolution":{"observed_at":"2026-08-05T16:46:49.234700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02769","last_updated":"2025-06-04T08:53:07Z","snapshot_observed_at":"2026-08-13T03:50:48.769602Z","submitted_at":"2025-03-04T16:34:14Z","title":"InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training","version":2},"cited_work":{"arxiv_id":"2503.02769","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.02769","snapshot_observed_at":"2026-08-05T16:46:49.407048Z","title":"InSerter: Speech Instruction Following with Unsupervised Interleaved Pre-training","venue":"cs.SD","work_id":"fbf63159-1baa-4cd4-92ee-c85b206d64bd","year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.237800Z"},"links":{"cited_paper":"/paper/2503.02769","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:bc44ab7ed42bc63fd2bd9c973152f20a0ad8407c8e38093a56ab4a46bfc4568e","observation_id":"b3502b97-07a2-4492-a9f7-d06e1864cb13","resolution":{"observed_at":"2026-08-05T16:46:49.412149Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-13T11:33:23.218633Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-05T16:46:49.240587Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.240587Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:baaab51dbaf49d04c70c74df6e21a322e2cf2edd678313484c0c13a354814b82","observation_id":"82e7c989-1115-41fd-9d0b-10bca00a2b5c","resolution":{"observed_at":"2026-08-05T16:46:49.240587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.838936Z","title":null,"venue":null,"work_id":"849c6a1d-1acc-4b54-9f11-e4a05b33b411","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.243540Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:6310d4942993309d8392bb750c62da332f27135ed882f47bea51d6837250a54f","observation_id":"31db02af-61fd-466c-b863-13297a7e3d11","resolution":{"observed_at":"2026-08-05T16:46:49.841549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-05T16:46:49.246073Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.246073Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:719aa2f89edb8039b957c2b68b11e688d12e1ae4bc03eb95a5a22060d9f43a8b","observation_id":"1e47ca38-e878-4336-b0eb-ce153a8f1336","resolution":{"observed_at":"2026-08-05T16:46:49.246073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.829830Z","title":null,"venue":null,"work_id":"dfe92553-e4cf-4346-b091-c030d2c0b5fa","year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.248919Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:1c24cf8a0c40ac5538a0428bbbbb0503dfc8635e31802ed2bea897e77388361e","observation_id":"794ca939-5f0f-460b-8cb1-be4930fd03a9","resolution":{"observed_at":"2026-08-05T16:46:49.832557Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-08-12T22:23:10.507095Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-05T16:46:49.251449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.251449Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:1b96b0407cca83dda1e5e6590ded3b161d6116ec7ca55918748212677dcdaf07","observation_id":"60f263ac-2bba-43eb-8519-23d2f46f4e95","resolution":{"observed_at":"2026-08-05T16:46:49.251449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T16:46:49.254645Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.254645Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:c9b0cf87b6c153df60ea852bb41db598f9172a576c27fa28f0465fbd89a71aa1","observation_id":"5b315595-faf4-4481-9962-1b2c55c9451b","resolution":{"observed_at":"2026-08-05T16:46:49.254645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00800","last_updated":"2024-09-01T18:29:45Z","snapshot_observed_at":"2026-08-12T22:53:32.270480Z","submitted_at":"2024-09-01T18:29:45Z","title":"Comparing Discrete and Continuous Space LLMs for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00800","snapshot_observed_at":"2026-08-05T16:46:49.257437Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.257437Z"},"links":{"cited_paper":"/paper/2409.00800","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:b59fe4f0088c1c0c38c0fc8f5ba624a8786d38bd5a4f8295268c6a3f685ed838","observation_id":"b1a419f0-0c28-45fa-8f38-e6035255882b","resolution":{"observed_at":"2026-08-05T16:46:49.257437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10344","last_updated":"2025-04-14T15:51:56Z","snapshot_observed_at":"2026-08-07T16:05:50.273054Z","submitted_at":"2025-04-14T15:51:56Z","title":"ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10344","snapshot_observed_at":"2026-08-05T16:46:49.260250Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.260250Z"},"links":{"cited_paper":"/paper/2504.10344","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:6cc0445bc53a1055b9b5491c5e834dd98948238e846a35acfbf6a768db25a5ed","observation_id":"edfe98b9-dc87-4e50-9f77-c65c579c2dbf","resolution":{"observed_at":"2026-08-05T16:46:49.260250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03939","last_updated":"2023-06-06T12:48:48Z","snapshot_observed_at":"2026-08-13T16:05:45.939853Z","submitted_at":"2022-04-08T08:59:33Z","title":"GigaST: A 10,000-hour Pseudo Speech Translation Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03939","snapshot_observed_at":"2026-08-05T16:46:49.262707Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.262707Z"},"links":{"cited_paper":"/paper/2204.03939","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:05e443281ae2260e02f8adf5f5a66cf5683cb85f4bb6651f1c4e743b5ffd5e4d","observation_id":"144c10e5-3bbb-4014-b9ec-f8b7e4a9d11e","resolution":{"observed_at":"2026-08-05T16:46:49.262707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.265779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.265779Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:cb2aa77e2fefe0e4eeee597401acec96a70446cbef9fd1ccd980c40fb961cf8e","observation_id":"a7fb8689-7e29-4934-9057-0f440c292082","resolution":{"observed_at":"2026-08-05T16:46:49.265779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.820371Z","title":null,"venue":null,"work_id":"9ec4fd95-9123-4059-9e76-5cc8e60429d7","year":2021},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.268492Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:47183c1250d665918547ab43d9ffc2690c38325e3376b823259f68f263d0b30f","observation_id":"e0daf9c9-2cad-4e82-9a27-23774e80b77b","resolution":{"observed_at":"2026-08-05T16:46:49.823915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-05T16:46:49.270919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.270919Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:fb104280d7a9e100c44036b08ec57ae3d5c604269d3eea1c69d67fda475da348","observation_id":"494656bc-0d91-41ad-b14b-d49cb69a3022","resolution":{"observed_at":"2026-08-05T16:46:49.270919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-05T16:46:49.273789Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.273789Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:94374d9432b9357518ba969222281e917efa6b5b18fdede80b24200c134ea41b","observation_id":"fcec29af-ec7c-4da5-a927-e41fc3fa48d8","resolution":{"observed_at":"2026-08-05T16:46:49.273789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-13T10:23:26.896178Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-05T16:46:49.276513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.276513Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:a8bdc33ac76c920777c1087791395e018a97b178a24df9d3f12b5452e4017eaa","observation_id":"e89c1e01-398a-4a9b-9a5f-14c3a259b39d","resolution":{"observed_at":"2026-08-05T16:46:49.276513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.279342Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.279342Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:2e2d78767b21bd3440f21934ed557796c60ea01ccf5a0a9686d1911d6a7742c2","observation_id":"5d45cb9e-8915-4788-a5b7-956688efa298","resolution":{"observed_at":"2026-08-05T16:46:49.279342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:46:49.282451Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.282451Z"},"links":{"citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:71c0a3d721622e4a262dd8b48b99b11aa2a64781ddbc62dc7ee9705b458d4a5d","observation_id":"446a4bcb-cf18-4417-b33f-cc99e74a81ab","resolution":{"observed_at":"2026-08-05T16:46:49.282451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":5,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 3 inbound Pith citation observations for arXiv:2508.17863."}