{"as_of":"2026-08-20T13:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:561188e01aa9b1bb3ae2b120845ce39465d9b9e2c2c96ffea267d7bacc18b4b0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":84,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:33:47.104090Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T08:29:41.322265Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T00:50:13.841689Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2410.17196"},"observation_digest":"sha256:b30ec9e1401e9d19c75f3c15c4a55c1d02894908f6014b9561a2729dc83f1be3","observation_id":"8ddcf9c2-c033-4b24-87c2-3fbb7dc8e4a2","resolution":{"observed_at":"2026-05-17T00:50:13.971194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T20:13:57.240429Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-20T13:09:54.981053Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.240429Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8b96dd25441bb67a211e4b56d87b00a6fc2d5581ece66293502dbe71c67071ee","observation_id":"c7753991-651d-4217-b129-458db8c2962a","resolution":{"observed_at":"2026-08-12T20:13:57.240429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T14:53:50.206384Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14842","last_updated":"2025-06-06T07:43:02Z","snapshot_observed_at":"2026-08-19T11:16:07.586434Z","submitted_at":"2024-11-22T10:30:48Z","title":"Who Can Withstand Chat-Audio Attacks? An Evaluation Benchmark for Large Audio-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T14:53:50.206384Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.14842"},"observation_digest":"sha256:7b6f181de10a1ac2dd275c0e57c037eca33b6741b092586868d77eafb7fb028e","observation_id":"b9dd0ca6-42d6-4fdf-8f04-b1419870419b","resolution":{"observed_at":"2026-08-12T14:53:50.206384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T12:02:40.403597Z","title":"Llama-omni: Seamless speech interaction with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-19T05:24:09.876190Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T12:02:40.403597Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.17607"},"observation_digest":"sha256:f4156884a52cf3384a2b31e0e9d68a71be558da95165390354ae830fe0511418","observation_id":"6b07796b-78fe-467d-88ca-5518f05d3131","resolution":{"observed_at":"2026-08-12T12:02:40.403597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T11:31:16.076477Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18138","last_updated":"2024-11-27T08:38:57Z","snapshot_observed_at":"2026-08-18T02:53:18.978175Z","submitted_at":"2024-11-27T08:38:57Z","title":"SALMONN-omni: A Codec-free LLM for Full-duplex Speech Understanding and Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:31:16.076477Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.18138"},"observation_digest":"sha256:fa12c1e651013400e75608429235d0e3783b2bcbfccf528d30a826216431d387","observation_id":"793b710c-ca7f-4778-9085-faa4fee8132c","resolution":{"observed_at":"2026-08-12T11:31:16.076477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:1253768a01b37bbadb676c48770707394032234b7c4603295208f0304d8b6c25","observation_id":"f6d2f7bb-0212-41b2-821f-8761c3a01feb","resolution":{"observed_at":"2026-05-16T03:53:47.496972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T21:12:23.997188Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04917","last_updated":"2024-12-06T10:16:04Z","snapshot_observed_at":"2026-08-15T20:01:57.260149Z","submitted_at":"2024-12-06T10:16:04Z","title":"Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:12:23.997188Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.04917"},"observation_digest":"sha256:8df89f3bcff97f684fb57a3f87e7042ad3eb514b2945b7114f07c6e320bb39f3","observation_id":"5267b4e2-7a21-48c7-9c16-7b84feba1748","resolution":{"observed_at":"2026-08-11T21:12:23.997188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T17:17:49.010166Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09168","last_updated":"2024-12-12T10:55:57Z","snapshot_observed_at":"2026-08-19T16:13:49.463844Z","submitted_at":"2024-12-12T10:55:57Z","title":"YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:17:49.010166Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.09168"},"observation_digest":"sha256:127e9d4c63b3861f5f2ba927bec1d5139e0b5a962fe1176bab271666a35ef81c","observation_id":"1740c986-f208-4950-9726-1a7c91a48106","resolution":{"observed_at":"2026-08-11T17:17:49.010166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T12:56:13.082251Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-08-18T10:39:43.720912Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T12:56:13.082251Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.13702"},"observation_digest":"sha256:bb303a2bbaec743586d22e0930d9a72bbbf8c518bcbcb8e794d6e1bb0250ddec","observation_id":"02f9e4d8-1345-404a-8365-fde8e928e8a7","resolution":{"observed_at":"2026-08-11T12:56:13.082251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T11:18:39.915261Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:39.915261Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.15649"},"observation_digest":"sha256:863725c9aaabfd3cc3584263eb63b48b9fdb8abedea1f3580391c7bfa9b2091f","observation_id":"a6b9e071-c877-45b1-afdd-4bd4948362f2","resolution":{"observed_at":"2026-08-11T11:18:39.915261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T11:13:48.447978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15712","last_updated":"2025-05-30T16:35:44Z","snapshot_observed_at":"2026-08-18T08:01:18.112437Z","submitted_at":"2024-12-20T09:33:31Z","title":"Contrastive Learning for Task-Independent SpeechLLM-Pretraining","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:13:48.447978Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.15712"},"observation_digest":"sha256:267b4cf2dae4ab53bf3197a2af712f2e6aae6398e5b14544631b23a4715e330c","observation_id":"1873b3af-7217-48c6-baad-3c2aa10ae3a5","resolution":{"observed_at":"2026-08-11T11:13:48.447978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T11:09:13.058336Z","title":"Llama-omni: Seam- less speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15838","last_updated":"2024-12-30T07:27:58Z","snapshot_observed_at":"2026-08-16T14:52:33.599355Z","submitted_at":"2024-12-20T12:27:16Z","title":"Align Anything: Training All-Modality Models to Follow Instructions with Language Feedback","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T11:09:13.058336Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.15838"},"observation_digest":"sha256:932cc7870094c2f80869e7523d233f0d2c945f2caf9532781b9295f3572eb2c1","observation_id":"4ea0a9ce-51d8-465f-bc6c-460ce4fd60b6","resolution":{"observed_at":"2026-08-11T11:09:13.058336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T10:18:36.175024Z","title":"Llama-omni: Seam- less speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16771","last_updated":"2024-12-21T20:52:32Z","snapshot_observed_at":"2026-08-15T15:03:14.210895Z","submitted_at":"2024-12-21T20:52:32Z","title":"SilVar: Speech Driven Multimodal Model for Reasoning Visual Question Answering and Object Localization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T10:18:36.175024Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.16771"},"observation_digest":"sha256:cd542afa903818d3b98851aeb399c8389d6166814c1ad32779aebbac0276be95","observation_id":"09b7180b-b8da-4e02-9e10-587fb06203fa","resolution":{"observed_at":"2026-08-11T10:18:36.175024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T05:12:12.117189Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17908","last_updated":"2025-04-21T18:58:16Z","snapshot_observed_at":"2026-08-19T02:52:57.321200Z","submitted_at":"2024-12-23T19:04:46Z","title":"Trading Devil RL: Backdoor attack via Stock market, Bayesian Optimization and Reinforcement Learning","version":3},"reference_index":169,"source":"pdf_text","source_observed_at":"2026-08-11T05:12:12.117189Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.17908"},"observation_digest":"sha256:b038ed87e31d7ce0079fbbfee7f4cee27ab218238ac55703dd6a03b25ea2ef0f","observation_id":"e1abac17-8c84-4617-9f2a-9005233c60d1","resolution":{"observed_at":"2026-08-11T05:12:12.117189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-11T14:59:01.635845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-19T22:19:56.931776Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.635845Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:c88ed1ba35602b028d3bbd1b26fd7f89c8e80031c5a3faec6d23a7f14d3b5eca","observation_id":"dbb3747d-9a84-433b-8943-faf1b8742dcc","resolution":{"observed_at":"2026-08-11T14:59:01.635845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-20T07:59:47.616406Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:a8830b93f3a12e59805c5aa196ad911747dc094afb9b612ab5c79e8e71931c32","observation_id":"31b3f180-c57e-4f57-a86e-2b8d1f4efb8f","resolution":{"observed_at":"2026-05-17T21:08:19.661305Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-10T21:10:56.674083Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:10:56.674083Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.06282"},"observation_digest":"sha256:66dbba78e59aca13ef9a534285e271763f920a319a004e82a4f873e28d86aedf","observation_id":"5b296ea0-6cfe-4575-8c7e-66e7714aa4ac","resolution":{"observed_at":"2026-08-10T21:10:56.674083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-10T14:40:55.207606Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-18T05:01:23.171038Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:40:55.207606Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.15111"},"observation_digest":"sha256:231a4ea0bcb6687a14ddb7102213d3e0548e4f4b2d96552a17dbd98506fcda5f","observation_id":"5ad67b38-507a-4932-9a0b-a80be510e8b9","resolution":{"observed_at":"2026-08-10T14:40:55.207606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-10T14:21:56.749133Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T14:21:56.749133Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.15442"},"observation_digest":"sha256:ebe959d0e6409e06e29ecfde457f1bba1bbbf7b93fe368d9cc45a93cb3d9bb96","observation_id":"2b0625f8-1a5c-4afe-88c1-573aebba36b8","resolution":{"observed_at":"2026-08-10T14:21:56.749133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-10T13:34:25.666909Z","title":"Llama-omni: Seamless speech interaction with large lan- guage models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16327","last_updated":"2025-01-27T18:59:51Z","snapshot_observed_at":"2026-08-12T15:20:37.673304Z","submitted_at":"2025-01-27T18:59:51Z","title":"LUCY: Linguistic Understanding and Control Yielding Early Stage of Her","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:34:25.666909Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2501.16327"},"observation_digest":"sha256:ee9a06ac520d9d434b0dc892ee120289cb12ca913f58c091807193136994359c","observation_id":"e45a97b2-31a9-47ef-bce1-ddf4d8165b37","resolution":{"observed_at":"2026-08-10T13:34:25.666909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-08T22:47:39.105733Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-08-20T01:50:23.816883Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T22:47:39.105733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.04328"},"observation_digest":"sha256:ce83085fc6777f27ea04cdf8689fe11035d29a89ebc28fb9222cdc59961c73b5","observation_id":"7dc3286d-0748-4cc8-888e-601fe4d49c74","resolution":{"observed_at":"2026-08-08T22:47:39.105733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T22:05:23.804113Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09284","last_updated":"2025-05-30T17:30:40Z","snapshot_observed_at":"2026-08-17T21:44:55.762301Z","submitted_at":"2025-02-13T12:57:15Z","title":"SparQLe: Speech Queries to Text Translation Through LLMs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T22:05:23.804113Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.09284"},"observation_digest":"sha256:aec56495971eb286bd5e13f81d2482d0f4061b5343c5690ec058f922cfde8910","observation_id":"b5002ec4-157b-4ce9-983b-9e285c585c7e","resolution":{"observed_at":"2026-08-07T22:05:23.804113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T20:02:51.322585Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-19T20:15:01.240634Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.322585Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:ab9b70a9075a6e520ab7f18a4b7aa15b70b30926ccfd199fea4bcdc27de716bf","observation_id":"d54a85f0-f0cb-403c-84be-bf3409720cca","resolution":{"observed_at":"2026-08-07T20:02:51.322585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:fb71fd65b7679b0bcb89d412af0264951021e3a6a258b67449d628e76797fa8a","observation_id":"2d3ae2fc-a0b0-4740-8024-10f7dbc5bf8e","resolution":{"observed_at":"2026-05-18T13:39:48.342720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-16T11:33:47.104090Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-18T11:09:01.459046Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:33:47.104090Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2504.15279"},"observation_digest":"sha256:41f42e68baa5cf17efb7edba77fe767defca38e2350993ca9a6619b8652641bc","observation_id":"400caaab-4ef9-4bcf-b1f2-ce21a04a3262","resolution":{"observed_at":"2026-08-16T11:33:47.104090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-16T11:30:21.844448Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15509","last_updated":"2025-04-22T01:05:32Z","snapshot_observed_at":"2026-08-17T18:21:34.488020Z","submitted_at":"2025-04-22T01:05:32Z","title":"SimulS2S-LLM: Unlocking Simultaneous Inference of Speech LLMs for Speech-to-Speech Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:30:21.844448Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2504.15509"},"observation_digest":"sha256:7a88954e5dc876f3c5d6d8d0d5af7abcf2a04675542196b171e09f0c5a421421","observation_id":"c42a38e6-940d-4402-9758-56a45182388f","resolution":{"observed_at":"2026-08-16T11:30:21.844448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:8d1322b1b05d69c22047db484a278fd65abf1f746a0661e5855d8a19f714ce92","observation_id":"033a91c0-6928-4fc0-91f1-3a1bdd811f0a","resolution":{"observed_at":"2026-05-11T19:21:27.234568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-15T20:21:32.388918Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13237","last_updated":"2025-08-24T16:09:17Z","snapshot_observed_at":"2026-08-16T01:24:03.349380Z","submitted_at":"2025-05-19T15:20:32Z","title":"SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:21:32.388918Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.13237"},"observation_digest":"sha256:adb1a34b9026eff5aca5af1f30f48bcb6d3472a7edc78516f143f50f928ce482","observation_id":"2be34161-d75b-4350-bbdb-f542090ae388","resolution":{"observed_at":"2026-08-15T20:21:32.388918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:39:33.966621Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14336","last_updated":"2025-05-21T14:22:18Z","snapshot_observed_at":"2026-08-17T23:11:54.259031Z","submitted_at":"2025-05-20T13:20:55Z","title":"Scaling and Enhancing LLM-based AVSR: A Sparse Mixture of Projectors Approach","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:39:33.966621Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14336"},"observation_digest":"sha256:0946527cb1f7bd93f37ee27585066352170df90488db28458f1d3deec8570fba","observation_id":"c07ba69b-84a4-4031-a186-ef95e4cb43fe","resolution":{"observed_at":"2026-08-07T15:39:33.966621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:38:36.938679Z","title":"arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14438","last_updated":"2025-05-20T14:42:20Z","snapshot_observed_at":"2026-08-15T14:03:57.903487Z","submitted_at":"2025-05-20T14:42:20Z","title":"S2SBench: A Benchmark for Quantifying Intelligence Degradation in Speech-to-Speech Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:36.938679Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14438"},"observation_digest":"sha256:9893f282c89153e10ecf4ddd28d209de739e855b1906175c39eb838f2d022fc6","observation_id":"507fb53f-1c52-4fb5-81b3-7edc9f0ec53b","resolution":{"observed_at":"2026-08-07T15:38:36.938679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:35:34.644120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-10T18:25:34.594517Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:34.644120Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:3f03511ada46f8fb5c8a4db7abec4d752bc0d9ea5cb902af674dd87982bba77a","observation_id":"180b0dc2-a501-411a-aaf2-b27ae8112244","resolution":{"observed_at":"2026-08-07T15:35:34.644120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T15:23:01.147173Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models // arXiv preprint arXiv:2409.06666","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-15T15:39:44.510248Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.147173Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:52817a401e1b107149903a5601dd6a377d0d55f74e89281c1398016e9fbbe748","observation_id":"dc9e1a5e-b5fa-4f82-8711-d91ee80fa622","resolution":{"observed_at":"2026-08-07T15:23:01.147173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:51:16.069890Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-17T02:24:20.568852Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:16.069890Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:266347eda2b1a9d03be6ac7e96ec03e634589e8b7cc869a1a446c5e6cec6abcd","observation_id":"0d13692c-21c8-42a9-bc12-cfe3f818b5c3","resolution":{"observed_at":"2026-08-07T14:51:16.069890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:19:55.644063Z","title":"Llama- omni: Seamless speech interaction with large language models.ArXiv, abs/2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:55.644063Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:325c4db4888a4788bc8f1a9c228e4e75d63e353b714bbbb1cf5be1072258c28e","observation_id":"9ca4f5b7-4a33-40d1-aa74-c22a6e2656c5","resolution":{"observed_at":"2026-08-07T14:19:55.644063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:16:33.562854Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19577","last_updated":"2025-06-30T16:21:25Z","snapshot_observed_at":"2026-08-16T15:45:40.750784Z","submitted_at":"2025-05-26T06:47:43Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.562854Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19577"},"observation_digest":"sha256:b8dde2682624677253e340997d12484c52bce4e0c4a4170711ce3469d4bb45db","observation_id":"a6c1b79e-1f1d-42bd-9d60-646fde200bf9","resolution":{"observed_at":"2026-08-07T14:16:33.562854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:15:55.598942Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19669","last_updated":"2025-06-02T10:03:25Z","snapshot_observed_at":"2026-08-09T04:17:24.541280Z","submitted_at":"2025-05-26T08:25:01Z","title":"Zero-Shot Streaming Text to Speech Synthesis with Transducer and Auto-Regressive Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:15:55.598942Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.19669"},"observation_digest":"sha256:987b71dc2ba587472ca18d0c421c34c815f394153168a019efa2c1a9f722b7f3","observation_id":"132089e7-bcf9-4ff1-ada2-857a733acffe","resolution":{"observed_at":"2026-08-07T14:15:55.598942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T14:01:30.307140Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-13T04:50:32.015134Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:30.307140Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:2094383f1987bbc841351fe18b6c81bd7be290499ea12da40ed5446808a76469","observation_id":"d802cbdc-6ea6-4981-8b07-cc34f1544fc9","resolution":{"observed_at":"2026-08-07T14:01:30.307140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T13:09:24.344367Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22566","last_updated":"2025-05-28T16:43:01Z","snapshot_observed_at":"2026-08-18T03:57:22.879757Z","submitted_at":"2025-05-28T16:43:01Z","title":"Universal Visuo-Tactile Video Understanding for Embodied Interaction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:09:24.344367Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2505.22566"},"observation_digest":"sha256:987d8224de461f56c691a320defee34f42595539bfcb443b69a6e3a0e58f2fe8","observation_id":"d3b73640-6507-408d-a905-1fce1cd35252","resolution":{"observed_at":"2026-08-07T13:09:24.344367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T12:04:31.966356Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:31.966356Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:14396dbcc514ae44de6eb0e941b847bb5f8dbd985cf360c14144345ee333aca4","observation_id":"ce5592c6-903f-44ff-ae2d-861a45d3c6c1","resolution":{"observed_at":"2026-08-07T12:04:31.966356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:35.040733Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-14T22:08:04.742170Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.040733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:6fe83ff3f920bf335ceeef51179ea122bd5a3a0a9ac20a2dd5834c2cdebda53e","observation_id":"9277ae40-93a8-402b-a2fb-6f5c118d4c39","resolution":{"observed_at":"2026-08-07T11:58:35.040733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:28:39.960930Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02414","last_updated":"2025-06-03T04:00:53Z","snapshot_observed_at":"2026-08-16T07:09:53.771363Z","submitted_at":"2025-06-03T04:00:53Z","title":"StarVC: A Unified Auto-Regressive Framework for Joint Text and Speech Generation in Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:39.960930Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.02414"},"observation_digest":"sha256:6141c48bf28a2b45a9afb95bab331d139df8695255a5dcb5b8001d52d5596b53","observation_id":"a38ced2f-e6bf-428d-9ab4-bc652ad434f4","resolution":{"observed_at":"2026-08-07T11:28:39.960930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:26:23.008363Z","title":"LLaMA-Omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-14T21:56:28.538771Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.008363Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:80e64f7081de2c35097a6da5a909259585692b16c45358367810e6e79e39ee51","observation_id":"3a38c437-6768-4ac8-b6b1-defd92aa8332","resolution":{"observed_at":"2026-08-07T11:26:23.008363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:40.924179Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-17T08:11:21.214669Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:40.924179Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:31bc442aaf894a72dc241096218eb305e713d3943979b71acb02b80fae04ed8c","observation_id":"076e0b54-13c8-48fa-aa92-1a3b5b45342a","resolution":{"observed_at":"2026-08-07T11:58:40.924179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T04:08:40.921978Z","title":"arXiv preprint arXiv:2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11521","last_updated":"2025-06-13T07:22:36Z","snapshot_observed_at":"2026-08-17T10:51:42.916638Z","submitted_at":"2025-06-13T07:22:36Z","title":"Investigating Vulnerabilities and Defenses Against Audio-Visual Attacks: A Comprehensive Survey Emphasizing Multimodal Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T04:08:40.921978Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.11521"},"observation_digest":"sha256:4a30a19ae9fce5d755c30589c34a6a26e2f6fc2c7d4d798c00c5899d73abfe43","observation_id":"1985f09c-790f-448f-ba7c-612b0d17d029","resolution":{"observed_at":"2026-08-07T04:08:40.921978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T19:23:47.250006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05863","last_updated":"2025-07-08T10:44:27Z","snapshot_observed_at":"2026-08-19T14:19:19.126945Z","submitted_at":"2025-07-08T10:44:27Z","title":"KERAG_R: Knowledge-Enhanced Retrieval-Augmented Generation for Recommendation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:23:47.250006Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.05863"},"observation_digest":"sha256:b87d65a2c5415c9c77e474be5584da5c95cea9dae7e7c45dc7a046977f32c1fe","observation_id":"d734e001-cd5d-4eee-9cd4-638a837d3b22","resolution":{"observed_at":"2026-08-06T19:23:47.250006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T18:21:32.233590Z","title":"Llama-omni: Seamless speech interaction with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-14T09:41:39.436098Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:32.233590Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:1a590fdd2a1af984234c3eee47b99cc9cc2b442d287d8d39a64a3f0b9c159287","observation_id":"60989bf5-f0e4-4c5f-ae7d-85c95a1d3c30","resolution":{"observed_at":"2026-08-06T18:21:32.233590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T16:47:55.871612Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:47:55.871612Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.12705"},"observation_digest":"sha256:92aaa85ad009f82c9edca59f8fae6af5eaf1fb3ceb01c0fe5771c51a50cf87af","observation_id":"c396d604-debf-4f00-846d-96cf0fba6658","resolution":{"observed_at":"2026-08-06T16:47:55.871612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T16:09:04.402999Z","title":"arXiv preprint arXiv:2409.06666 (2024) Title Suppressed Due to Excessive Length 15","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14412","last_updated":"2025-07-18T23:36:06Z","snapshot_observed_at":"2026-08-18T22:06:15.242601Z","submitted_at":"2025-07-18T23:36:06Z","title":"Personalized Socially Assistive Robots With End-to-End Speech-Language Models For Well-Being Support","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:09:04.402999Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.14412"},"observation_digest":"sha256:a81d5363d93c7e280b39bb9861a43fef84a63ea621c285bf0fe593a9135f6cb8","observation_id":"f9ecc50f-fee8-4c79-bd65-941214304f01","resolution":{"observed_at":"2026-08-06T16:09:04.402999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:a9b6dece34b7de501a38b925fdbd5c6f89efafeab64f42f8e0bdaa938176c384","observation_id":"cdb8ac00-ddad-47a7-abd9-6780ddf68f6e","resolution":{"observed_at":"2026-05-16T05:59:51.023035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:50:04.291383Z","title":"ArXiv abs/2409.06666 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-17T15:47:47.299538Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.291383Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:575cba21c3d3e71144414bac7d453442ebe5867d37e620b6841e11837e135b05","observation_id":"275754a4-9a8c-48fc-8896-d67dea81c1d9","resolution":{"observed_at":"2026-08-06T14:50:04.291383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-15T18:22:44.224384Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17735","last_updated":"2025-07-23T17:51:03Z","snapshot_observed_at":"2026-08-18T17:53:29.392862Z","submitted_at":"2025-07-23T17:51:03Z","title":"Accent Normalization Using Self-Supervised Discrete Tokens with Non-Parallel Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T18:22:44.224384Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.17735"},"observation_digest":"sha256:28e4edc7ab0bcd4e773399d6866f5615753b163298b53d52cd7d2d77f7721a34","observation_id":"e8048819-f9d5-4b44-b9d1-b147f6b4654e","resolution":{"observed_at":"2026-08-15T18:22:44.224384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-06T14:42:56.043822Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.18181","last_updated":"2025-07-28T08:55:09Z","snapshot_observed_at":"2026-08-15T09:21:04.969128Z","submitted_at":"2025-07-24T08:27:53Z","title":"SpecASR: Accelerating LLM-based Automatic Speech Recognition via Speculative Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:42:56.043822Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.18181"},"observation_digest":"sha256:6b3905afb060728edc2a0712fc4a9b8292cdf7126b6e548661959bf08f60d89b","observation_id":"65f20b7f-5213-4063-be88-bbe4978d02b0","resolution":{"observed_at":"2026-08-06T14:42:56.043822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-15T17:52:28.613808Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20400","last_updated":"2025-07-27T19:49:15Z","snapshot_observed_at":"2026-08-20T12:41:46.608507Z","submitted_at":"2025-07-27T19:49:15Z","title":"Beyond Value Functions: Single-Loop Bilevel Optimization under Flatness Conditions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:52:28.613808Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2507.20400"},"observation_digest":"sha256:c06e2df4abc0f804d75a4ed32f8f556cba3907816c6f5a91ef02a11573036fb4","observation_id":"e9d9c51a-45a3-417b-88a7-66d03301e2a5","resolution":{"observed_at":"2026-08-15T17:52:28.613808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-05T21:45:23.907075Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08095","last_updated":"2025-08-11T15:33:44Z","snapshot_observed_at":"2026-08-15T04:15:26.127366Z","submitted_at":"2025-08-11T15:33:44Z","title":"Dual Information Speech Language Models for Emotional Conversations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:45:23.907075Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.08095"},"observation_digest":"sha256:1be9707fbf46dd78f37fcc1bab13a0e5dbba991a908788cfc84fa6c4b24add27","observation_id":"60e45a49-bb4c-47c9-8812-24061e498963","resolution":{"observed_at":"2026-08-05T21:45:23.907075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-08-12T14:43:37.008792Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:1e92b32e8f986847ccb9d4424dbc095a5572d27942189856966458909a735c2c","observation_id":"ee928dbd-a44f-4c45-9c7c-8826b58e7890","resolution":{"observed_at":"2026-05-19T00:12:54.167660Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-08-12T14:43:37.008792Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:349b8c96c0f7f295adf4b40c206b52ff29bf5e780bd27bb467d9c31c17b9a0c7","observation_id":"ddc7832d-be84-4b6a-a021-89c7de4e3344","resolution":{"observed_at":"2026-05-25T08:05:30.612129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-05T17:56:51.856505Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.15418","last_updated":"2025-08-21T10:20:00Z","snapshot_observed_at":"2026-08-14T16:19:43.372797Z","submitted_at":"2025-08-21T10:20:00Z","title":"LLaSO: A Foundational Framework for Reproducible Research in Large Language and Speech Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T17:56:51.856505Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2508.15418"},"observation_digest":"sha256:8d734c57dda663904b6e8401aac9a83e72ea3f6c6feafae9a414e908512e4573","observation_id":"ff509164-128d-453b-85bd-ae5fef3a68fa","resolution":{"observed_at":"2026-08-05T17:56:51.856505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-15T03:55:37.990374Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:7ba18e1ef1d5b65d524ed2c96eaff1ab60d4d1e9a90677d5d6f648f31b499158","observation_id":"ef60b9df-dd01-4cfb-a286-ad7713ca6c18","resolution":{"observed_at":"2026-05-21T22:24:23.513736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T23:33:04.355944Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.355944Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:470793ef67650cbf88133fe745d1141c13fb42959cc841f4704f00b92b36ac4b","observation_id":"91a0b4c1-b79f-45db-8bae-2e63819c3e44","resolution":{"observed_at":"2026-08-04T23:33:04.355944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:f8f0b50c8fcc6712c881355835df6cbc4a6095c1ce6eb13f72a2c5d239af3f1e","observation_id":"bca84238-c1e2-4017-a014-0ee3f5b7d255","resolution":{"observed_at":"2026-05-18T13:01:24.361876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T11:06:44.086529Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-16T08:16:49.998738Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.086529Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:bfbb2fcaac204e31d1dea8fca8603ee35e8f695f1b8cdb9a155c18808cdfad78","observation_id":"55ce28e0-4813-4353-8197-81b50a8f88de","resolution":{"observed_at":"2026-08-04T11:06:44.086529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2602.22710","last_updated":"2026-05-06T21:24:15Z","snapshot_observed_at":"2026-08-14T07:46:59.545255Z","submitted_at":"2026-02-26T07:34:15Z","title":"Same Words, Different Judgments: How Preferences Vary Across Modalities","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T19:31:51.996480Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2602.22710"},"observation_digest":"sha256:d57b2d93852d84f7bbba430432339229a6f024349037dbbb6c67a44f69f7929a","observation_id":"73d20c5c-f39d-4b87-a946-54358ef0a2a3","resolution":{"observed_at":"2026-05-15T19:36:33.038978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-02T18:42:05.886184Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07025","last_updated":"2026-07-24T15:35:47Z","snapshot_observed_at":"2026-08-12T12:51:29.214778Z","submitted_at":"2026-03-07T04:09:47Z","title":"Language-Aware Distillation for Multilingual Instruction-Following Speech LLMs with ASR-Only Supervision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:42:05.886184Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2603.07025"},"observation_digest":"sha256:a968e0167d005f7bfcd1a800daac9802dbd69cc82de93bf9e6166502d81b2b11","observation_id":"941f052b-a146-45b8-b2c5-7596fdacdd7f","resolution":{"observed_at":"2026-08-02T18:42:05.886184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-14T21:25:19.253843Z","title":"Llama- omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14275","last_updated":"2026-06-22T16:56:11Z","snapshot_observed_at":"2026-08-14T19:45:18.587813Z","submitted_at":"2026-03-15T08:17:25Z","title":"Controllable Accent Normalization via Discrete Diffusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T21:25:19.253843Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2603.14275"},"observation_digest":"sha256:50564c5513709842bc5df324ae65ec296fd01723674e0a15ccbae247798f43d7","observation_id":"8cf905bd-13d5-4852-88e2-5551808ab626","resolution":{"observed_at":"2026-07-14T21:25:19.253843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.03937","last_updated":"2026-05-05T16:27:33Z","snapshot_observed_at":"2026-08-16T16:01:14.715034Z","submitted_at":"2026-05-05T16:27:33Z","title":"MiniMind-O Technical Report: An Open Small-Scale Speech-Native Omni Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:34:50.848124Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.03937"},"observation_digest":"sha256:4589765531128227ca8f0b95db95ce7cf835d6bc925aa4914ed747da25ce634c","observation_id":"18bc937b-afd2-45c0-be4a-79329bb0cbe7","resolution":{"observed_at":"2026-05-11T16:41:08.488015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.04700","last_updated":"2026-05-25T06:36:12Z","snapshot_observed_at":"2026-08-13T16:12:54.534911Z","submitted_at":"2026-05-06T09:52:29Z","title":"Sparse Tokens Suffice: Jailbreaking Audio Language Models via Token-Aware Gradient Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T18:08:16.051117Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.04700"},"observation_digest":"sha256:329ebbf050b4b3b264964eceeae7bf751532d4de0c0e75f94190c73553a83be9","observation_id":"e57d5363-c6af-4b86-8681-b2d59a1be6c0","resolution":{"observed_at":"2026-05-09T06:45:44.079790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:7c2f7c2f7ebe1cdfcb4e64a8fb0dde915c0a78fe9a26058e682cb8267dfaa760","observation_id":"be8c5c01-a85f-4883-87da-1846317b008e","resolution":{"observed_at":"2026-05-11T19:46:15.262510Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:7f6e19128c098fc030e15e48e45d5cb0b147795e10f229674b20581355de0a39","observation_id":"7cb90703-4bc7-4fcc-9550-4a20e3920691","resolution":{"observed_at":"2026-05-11T00:50:49.611468Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:83346e0b7837ac0325998fa01a64694ec27ce9d505930162b92d0a2eb342e3d2","observation_id":"cf1b243e-3b0c-46ae-8eb7-1a1e3436288e","resolution":{"observed_at":"2026-05-11T04:50:55.866632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-16T00:00:14.809961Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:eaabd64e8faf42ed4f249864fec2e5ce2a83aea906874b8cce89817301290b96","observation_id":"df2398ca-422d-4bb7-b0a5-6b4af5991141","resolution":{"observed_at":"2026-05-21T07:39:48.969176Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:e5a124dc4ad68311403d4fd5e2219549d7f8ee601d28178a018132bb4b4a995b","observation_id":"db74770c-bf98-4781-9492-e175e48af0a3","resolution":{"observed_at":"2026-05-21T02:43:55.027484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-17T17:49:50.443103Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:9d70ce30bd1a1f22ae352251e3cf67e0c7bebf5fc94313a7fb15cd8763644a65","observation_id":"4838ffaa-416f-4089-8ce4-244f17c814de","resolution":{"observed_at":"2026-06-30T17:34:57.361577Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.21008","last_updated":"2026-05-20T10:44:56Z","snapshot_observed_at":"2026-08-15T09:30:05.500365Z","submitted_at":"2026-05-20T10:44:56Z","title":"A Survey of Audio Reasoning in Multimodal Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T02:08:06.976461Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.21008"},"observation_digest":"sha256:1bd59318e430d2473700a5ef2e05c0382485f452d82e25f74bc42306f719a3a2","observation_id":"a6d8c1b2-019d-468f-ad1a-814d5b2a6a22","resolution":{"observed_at":"2026-05-21T02:09:24.368254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2605.31294","last_updated":"2026-05-29T13:31:11Z","snapshot_observed_at":"2026-08-03T04:28:51.404629Z","submitted_at":"2026-05-29T13:31:11Z","title":"TokTalk: Expressive Real-time Facial Animation from Audio-LLM Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T22:45:39.443440Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2605.31294"},"observation_digest":"sha256:503194e4cdce97c4325ea19bb2c4bd01e49f8dba48813847c121e9ce8070dc88","observation_id":"a43b7391-d3e0-4f63-9793-c00a05313c7a","resolution":{"observed_at":"2026-07-01T19:25:59.872963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-14T14:46:55.727050Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:2702f193a0fd2f74a8fed18cb215109b5df53b8df8cc43469aacb189e6117cfa","observation_id":"65b49c1b-dac7-4476-b120-6205597d2b6d","resolution":{"observed_at":"2026-07-02T10:46:52.413130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:397543725e59bf9b34d1765798697d50b96aa917dbad09f28db7d5a5042da34c","observation_id":"eb3d44dd-5b67-4797-96c8-e90f5dc44120","resolution":{"observed_at":"2026-07-02T17:27:15.662681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.11400","last_updated":"2026-06-09T19:44:46Z","snapshot_observed_at":"2026-08-12T19:22:14.929587Z","submitted_at":"2026-06-09T19:44:46Z","title":"Steering Where to Listen: Instruction-Based Activation Steering Redirects Temporal Attention in Large Audio-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:29:36.012349Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.11400"},"observation_digest":"sha256:1c0cd005115b54aa066e8783d5bbdf0f96836f7fe36b082d5eb6aa1520539cd7","observation_id":"084cd552-38f0-4ee4-a5de-dac922514b7d","resolution":{"observed_at":"2026-07-03T07:57:44.819997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-14T07:37:13.185382Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:5d675553dd6fbc8f1fa4fe65a0d4a2914a76a573db5c7000bee8af02b4766ae1","observation_id":"a53e1ce9-d567-4f85-9ed0-d0ab6702f9c2","resolution":{"observed_at":"2026-07-03T13:18:12.825126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.21882","last_updated":"2026-06-20T04:47:45Z","snapshot_observed_at":"2026-08-14T10:26:55.067898Z","submitted_at":"2026-06-20T04:47:45Z","title":"Streaming T5-based Text-to-Speech Synthesis with Limited Lookahead","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T11:42:44.035902Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.21882"},"observation_digest":"sha256:d91da3dc6240f5bd998285486aec4d57a92b2cd1aa423d4f9b0e3ebaad817ca6","observation_id":"6f7c5947-006b-4b80-9cfb-cf4596cd38eb","resolution":{"observed_at":"2026-07-04T08:29:41.323872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":"2409.06666","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-04T08:29:41.322265Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":"130f0aad-80b2-40cc-a118-ad7dd036cb72","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":215,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:4719cfa3bb7a7ae4f3bb5a67a1a01dcc03a6515f0911eb7fd09874fc433e3f39","observation_id":"2ae65a48-4f96-4a77-8557-222645a0aa62","resolution":{"observed_at":"2026-07-01T11:55:42.281653Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-12T08:09:44.957032Z","title":"LLaMA-Omni : Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02640","last_updated":"2026-07-02T15:59:01Z","snapshot_observed_at":"2026-08-15T04:44:05.869730Z","submitted_at":"2026-07-02T15:59:01Z","title":"Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T08:09:44.957032Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.02640"},"observation_digest":"sha256:89747c3dc11ed82681f274319b650263a25b8606fb16e80eeaa92ebdb9ddc60c","observation_id":"6199ec6f-8f95-4bcb-a4d8-b464e14d29db","resolution":{"observed_at":"2026-07-12T08:09:44.957032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-07-11T22:58:27.449735Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03928","last_updated":"2026-07-04T15:45:38Z","snapshot_observed_at":"2026-08-18T17:12:52.778505Z","submitted_at":"2026-07-04T15:45:38Z","title":"TokAN: Accent Normalization Using Self-Supervised Speech Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T22:58:27.449735Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.03928"},"observation_digest":"sha256:912c71154f6c72af340b0ec8a7bff0ef1273aba829613dfed667164efb92293e","observation_id":"a130e201-e309-4fdf-bb17-135aa45b6047","resolution":{"observed_at":"2026-07-11T22:58:27.449735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T07:12:13.127289Z","title":"arXiv preprint arXiv:2409.06666 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-19T18:23:07.835586Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:13.127289Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:f8bb71e0e474ab5df86bd073b034f6a19176bcef321deef8dac3c6eea8e5a085","observation_id":"788183f2-e31e-4971-a137-16cb22e0c543","resolution":{"observed_at":"2026-08-01T07:12:13.127289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-01T01:56:11.344932Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27756","last_updated":"2026-07-30T06:53:15Z","snapshot_observed_at":"2026-08-20T09:56:48.839708Z","submitted_at":"2026-07-30T06:53:15Z","title":"Cocktail-Talker: Multi-Speaker Dialog Modeling in Noisy Social Environments with Turn Action GRPO","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T01:56:11.344932Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2607.27756"},"observation_digest":"sha256:d25bcd1b47b78a872a9aabbb8ddb7c6680a902b451aa1b0e943b011c09fb9cfe","observation_id":"5e6763b9-2544-45e1-82ae-e2b4c8cbe348","resolution":{"observed_at":"2026-08-01T01:56:11.344932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2409.06666/citation-record","integrity":"/paper/2409.06666/integrity","json":"/paper/2409.06666/citation-record.json","paper":"/paper/2409.06666"},"outbound":[],"paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 84 inbound Pith citation observations for arXiv:2409.06666."}