{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:754270713abbc68ae1b5bf8e46be7f4bd83586d09b8dd11fdf25790176331f17","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:41.303521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T02:49:25.043605Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:546b8de6383e15e6a6c213abd17a0075032734f76921071d18b95ac084d2c306","observation_id":"abae069a-dbed-4db4-87c3-2b4187cdda19","resolution":{"observed_at":"2026-05-16T03:53:47.520398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2501.01957","last_updated":"2025-10-24T02:32:10Z","snapshot_observed_at":"2026-08-06T10:28:03.148202Z","submitted_at":"2025-01-03T18:59:52Z","title":"VITA-1.5: Towards GPT-4o Level Real-Time Vision and Speech Interaction","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:19.570050Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2501.01957"},"observation_digest":"sha256:197b88d160b3a525eb35107a2e7b6b808825fb11c5c8173d9613461dace790cc","observation_id":"b647c8de-ec50-4927-921c-acc2855f6f16","resolution":{"observed_at":"2026-05-17T21:08:19.680358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:baa82215d2c5870d6052db0ec2fa18a75dd0175b2835930ebc352adba888ee90","observation_id":"eef0cf8f-ad35-490b-9f52-6c2b723ccec9","resolution":{"observed_at":"2026-05-18T13:39:48.390382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:422f0ae054e066bf3639df0da59c57d73f8e80bab6316bc4e55d7d207a58f0bc","observation_id":"a3436f6e-4265-4c1a-9431-8b3e1c4da8e8","resolution":{"observed_at":"2026-05-11T19:21:27.083009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2505.14654","last_updated":"2026-05-20T07:14:52Z","snapshot_observed_at":"2026-07-06T21:27:18.398824Z","submitted_at":"2025-05-20T17:42:34Z","title":"Beyond Words: Multimodal LLM Knows When to Speak","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T13:31:26.532921Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2505.14654"},"observation_digest":"sha256:c517a715bc71c1729caafc836f03bdf11cc4fb2d5d8c077592529717190f08cf","observation_id":"70d29ff1-c4a9-4617-9f1a-5ef617c2d357","resolution":{"observed_at":"2026-05-22T13:31:36.003748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T15:15:41.303521Z","title":"Freeze-omni: A smart and low latency speech-to-speech dia- logue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15670","last_updated":"2025-07-25T15:07:10Z","snapshot_observed_at":"2026-08-09T02:59:04.485815Z","submitted_at":"2025-05-21T15:48:30Z","title":"SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.303521Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2505.15670"},"observation_digest":"sha256:67bae6f5ce369a9e25a4c2954d05926fd0b9989579c3713b8a55ff86851652e5","observation_id":"33b497fc-fbcc-4410-a8e5-9be4634c3e0a","resolution":{"observed_at":"2026-08-07T15:15:41.303521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T11:26:23.253202Z","title":"Freeze- Omni: A smart and low latency speech-to-speech dialogue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-10T06:54:09.759058Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.253202Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:7dfd2d612fe6778353aa7b4b016e3d33195517a227e7b18c5b5c4de02c82129e","observation_id":"fd4d79c4-b7f4-466a-bb6d-a80d9ec59e96","resolution":{"observed_at":"2026-08-07T11:26:23.253202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T11:58:41.015033Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06343","last_updated":"2025-06-01T09:27:55Z","snapshot_observed_at":"2026-08-09T06:02:47.435740Z","submitted_at":"2025-06-01T09:27:55Z","title":"TESU-LLM: Training Speech-LLMs Without Speech via Unified Encoder Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:58:41.015033Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.06343"},"observation_digest":"sha256:496b6d675a17cb52a185bb9f40b4775721010de043089432167aa15fb69362a2","observation_id":"0e806ba7-755f-4f05-b107-ee54be2e91b8","resolution":{"observed_at":"2026-08-07T11:58:41.015033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-07T00:33:19.341323Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13642","last_updated":"2025-06-22T07:56:58Z","snapshot_observed_at":"2026-08-09T02:59:40.714095Z","submitted_at":"2025-06-16T16:06:45Z","title":"Stream-Omni: Simultaneous Multimodal Interactions with Large Language-Vision-Speech Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:33:19.341323Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2506.13642"},"observation_digest":"sha256:24ae459f8e4a5938bfc372f378191c3fb52aa6428c1ca55a6e423a65fccb70ff","observation_id":"e40c7e43-5d2a-4814-a945-19f891f788fb","resolution":{"observed_at":"2026-08-07T00:33:19.341323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T17:52:01.469864Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09834","last_updated":"2025-07-14T00:14:54Z","snapshot_observed_at":"2026-08-08T23:02:17.585184Z","submitted_at":"2025-07-14T00:14:54Z","title":"Generative Audio Language Modeling with Continuous-valued Tokens and Masked Next-Token Prediction","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T17:52:01.469864Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.09834"},"observation_digest":"sha256:052c8918743a55711e2b04eb4adf4a4debcaf40ca6300c11b5eb6643eb522939","observation_id":"d0e3b8bf-90c4-49c6-8219-cfe9ef22e744","resolution":{"observed_at":"2026-08-06T17:52:01.469864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:0b4e268076aab54a785528446d909b6093116bb81695eda667999daf391f9b3e","observation_id":"532a21d1-7a9f-4c26-a582-7550813991d3","resolution":{"observed_at":"2026-05-16T05:59:51.063110Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T14:50:04.306448Z","title":"arXiv preprint arXiv:2411.00774 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.306448Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:fbe1b17f0adc439d3daf450d698230677bf1350549703b8b30972b3e4236bc65","observation_id":"9411af84-8233-4e5b-af70-fcd682a869a0","resolution":{"observed_at":"2026-08-06T14:50:04.306448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:ac2b9809e7aa3d4ed5359e765b6553873a6e65dd3847f4602f125f0cedd61a4e","observation_id":"9506fd3f-2eeb-458c-b029-ed36eae169eb","resolution":{"observed_at":"2026-05-19T00:12:54.079300Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:bf482ce922652332069c21b877412cc59b7480076621300d27bc07dbd268104c","observation_id":"cbe65bb6-1dab-4fbc-83c0-aa5d6f3ad7fa","resolution":{"observed_at":"2026-05-25T08:05:30.811981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-04T23:33:04.388843Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm.arXiv preprint arXiv:2411.00774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.388843Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:05f203b901509917ed167651e6047381aef1dfbefe85442b362f3d2cd31fd40e","observation_id":"f0ab0b96-75d1-446c-944d-1a3dc177c3d3","resolution":{"observed_at":"2026-08-04T23:33:04.388843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:14777f41407c6752fd9e8817fa89fdf11c05111418d78ddeaadc5bef33905d9f","observation_id":"050ac82d-14d1-4658-bac8-7b4904c2fa6e","resolution":{"observed_at":"2026-05-18T16:31:37.205947Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:db4cc192181cb7504952cffe387068c4e56c6fa131f1a1a9adc085ffa10630fc","observation_id":"6e2ce822-5c73-4964-9132-5967e2ff9bbc","resolution":{"observed_at":"2026-05-18T13:01:24.286498Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-04T11:06:44.360493Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.360493Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:a365978dabebff2d1c2dee16d412c0b11bac8490934bce468d8039215a557296","observation_id":"875ecdf8-0960-418d-b24a-1bc98129c738","resolution":{"observed_at":"2026-08-04T11:06:44.360493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-15T08:34:56.898815Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:e04cb65b640562508bde96b82cf469bf6071f7f2e49511181fcb15d7f2948b04","observation_id":"b6c7d276-875f-4385-b79c-ff404d291883","resolution":{"observed_at":"2026-05-15T08:35:18.308768Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T10:43:27.176535Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:7b95c45b9375239b7f59c124a4c800eec357b8ca9d9ae0f8c4e6d196958928b0","observation_id":"3c672184-6bf8-4797-8a9d-457a07d83018","resolution":{"observed_at":"2026-05-21T10:44:07.690636Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-13T22:57:11.059962Z","title":"A full-duplex speech dialogue scheme based on large language model.Advances in Neural Information Pro- cessing Systems, 37:13372–13403, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T22:57:11.059962Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:06691830fd0d1b637042b6bb0ad694a70b1e51fcf7cccc75c0dfa8a59308030a","observation_id":"baa5aeb6-f915-4bf1-9d7f-579f1722c107","resolution":{"observed_at":"2026-07-13T22:57:11.059962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Freeze-omni: A smart and low latency speech-to-speech dia- logue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-06T15:48:40.631159Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:3fe7ac479e357b7dece4d073c0c30891f595412338efd93e15257caa40daac0a","observation_id":"406b4d52-04ec-4799-83ab-23ac10707f45","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:2b678386cb444ded46ed7886bb3edffe3d6c397c20d63f877060825ae4971b03","observation_id":"fa7b331c-ebc2-4724-8893-422a48f620ac","resolution":{"observed_at":"2026-05-13T20:58:15.977586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2604.21406","last_updated":"2026-04-24T04:15:19Z","snapshot_observed_at":"2026-07-30T10:09:24.521843Z","submitted_at":"2026-04-23T08:21:52Z","title":"Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T13:19:44.156822Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2604.21406"},"observation_digest":"sha256:bd2cebe2d9f1f65af475da995f301beb742d92c942c9c8812f0de3d69c521003","observation_id":"64dfc8f1-7a60-4ab7-99d9-8346edfbfcaa","resolution":{"observed_at":"2026-05-11T18:56:06.773428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:6d1f0215a67450f91956702274decfd3243e4d1aad063726f45bdb6356cd78e2","observation_id":"64976695-458e-4845-a071-2d77b9ec5bc0","resolution":{"observed_at":"2026-05-11T04:50:55.782660Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:00b90ba6e69e42578e8f5e228c82f3e4083d251c1c7a02ea176391c693f23fc6","observation_id":"50d7ac62-7679-4c69-bb0b-3563ebc80c57","resolution":{"observed_at":"2026-05-21T07:39:48.633916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:d995d6d4c54de0fc7dcfdd89253a21c1747ea5e0d8242bd0a3fee7978e91144f","observation_id":"5f1e38ba-87d2-4a20-86df-7c8f1a7fa4cb","resolution":{"observed_at":"2026-05-21T02:43:55.070044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:b80e805b4c0dc14f6cc9c857699eb511a00603113606dc35ecf6c65588195256","observation_id":"9ba951a5-3065-44ce-8f9f-83ddbaf3159d","resolution":{"observed_at":"2026-06-30T17:34:57.380968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-13T08:22:44.347941Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.23912","last_updated":"2026-04-08T23:43:46Z","snapshot_observed_at":"2026-08-08T18:14:47.595645Z","submitted_at":"2026-04-08T23:43:46Z","title":"Raon-Speech Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T08:22:44.347941Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.23912"},"observation_digest":"sha256:bfc8667c7c1baf0b6ec1e8c9711e364b7b3cdbb70b89b8531dbd574aca1d9c32","observation_id":"c7955dae-ab99-44bc-9b38-f2357ccca974","resolution":{"observed_at":"2026-07-13T08:22:44.347941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2605.27190","last_updated":"2026-05-26T15:43:11Z","snapshot_observed_at":"2026-08-06T18:21:13.610239Z","submitted_at":"2026-05-26T15:43:11Z","title":"Learning When to Think While Listening in Large Audio-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T18:37:34.409802Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2605.27190"},"observation_digest":"sha256:b32e3260a77afc365432d2add3cb807c546dcb5d2793083b3c9b188d8d1cadd2","observation_id":"82ceda9f-63db-438f-8c2c-4edb2cd1c888","resolution":{"observed_at":"2026-06-29T18:43:50.760010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.05121","last_updated":"2026-06-03T17:26:11Z","snapshot_observed_at":"2026-08-02T17:56:34.317060Z","submitted_at":"2026-06-03T17:26:11Z","title":"Audio Interaction Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T04:57:05.062465Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.05121"},"observation_digest":"sha256:c7dca69937f925cb85e4193f72a5d47254abd78eec0882ae50e5804ebe614e98","observation_id":"7903bc9d-253b-4979-aff2-1d48af51bfaa","resolution":{"observed_at":"2026-07-02T10:46:52.400863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-02T15:33:37.373792Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T23:42:38.203116Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.06559"},"observation_digest":"sha256:9fd3c2c6f7bdb3399dd7e4e71d930f10cbbd48733f944207d931d59bbc4d6619","observation_id":"886a5fbe-a2c0-4e68-a2b6-86fd427837c2","resolution":{"observed_at":"2026-07-02T15:37:06.807408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.12199","last_updated":"2026-06-10T15:19:15Z","snapshot_observed_at":"2026-08-07T21:59:04.835770Z","submitted_at":"2026-06-10T15:19:15Z","title":"Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T08:18:23.182355Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.12199"},"observation_digest":"sha256:273458e724c3858655b472b608affba693031479c18228d89e35502af506b38e","observation_id":"e3854dc8-bc48-4565-95da-21b99a907f74","resolution":{"observed_at":"2026-07-03T13:18:12.835252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T05:32:27.371597Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:d605dedf6fbdb5d6d57593a16cca703c02e84d4fff1db02ca609a46a0e35b6bb","observation_id":"606dd4cc-93fe-49d5-a83a-511298c5da8f","resolution":{"observed_at":"2026-07-03T16:28:39.533604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:01:44.202712Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:ebe6c92d70c80c3c6eb4b379a644fc1fbb19770986e5bcf781a84d763903e6d8","observation_id":"1321db71-8e75-4f38-a674-e6fb7383c948","resolution":{"observed_at":"2026-06-29T18:43:51.429171Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:8bc2cacbd6031e4001c5b1fa670505280e5e7fa5587df51524f9e546c31dce48","observation_id":"64a7b10f-e728-42bc-8c56-6c2e0ddecfdc","resolution":{"observed_at":"2026-07-04T02:49:25.045148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.30145","last_updated":"2026-06-29T11:22:50Z","snapshot_observed_at":"2026-08-08T07:29:41.174359Z","submitted_at":"2026-06-29T11:22:50Z","title":"FacePlex: Full-Duplex Joint Speech-Facial Motion Generation for Conversational Avatars","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:38:28.718164Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.30145"},"observation_digest":"sha256:0a827b1bc95a26c3e6cb0f4aa44134ff7b21ee14a369660310d116639a793ca7","observation_id":"24b875d5-c0d1-43c8-8c33-da00620d2ab7","resolution":{"observed_at":"2026-06-30T06:44:19.416518Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-07T21:37:48.909123Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:d26e465b24e1f9b35341f2b0b342c90970dcc610daec7c90d5f170f08e7883aa","observation_id":"3cbc1c14-2319-4db7-a69a-b13171bb03a9","resolution":{"observed_at":"2026-07-01T13:05:45.847968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":216,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:fa48cd1642e21a03b14d31fd33a9a257134c7be4c4053265e859296429180016","observation_id":"c5891d88-aa53-4c4e-a6e1-1cd840b0eb77","resolution":{"observed_at":"2026-07-01T11:55:42.220803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":"2411.00774","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-07-04T02:49:25.043605Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":"65441f0b-9103-494d-b83b-8d7c6235ed67","year":2024},"citing_paper":{"arxiv_id":"2607.02214","last_updated":"2026-07-02T14:22:46Z","snapshot_observed_at":"2026-07-07T00:07:42.752664Z","submitted_at":"2026-07-02T14:22:46Z","title":"Unlocking Speech-Text Compositional Powers: Instruction-Following Speech Language Models without Instruction Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-03T14:35:17.004680Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2607.02214"},"observation_digest":"sha256:e4cfb8128529383981fb4e2fa44b70e8b63774773fbea5d25161f98935f8ca44","observation_id":"986e7776-14a4-468f-bf4e-a2445abaa5ec","resolution":{"observed_at":"2026-07-03T14:38:28.611230Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-02T13:57:31.306452Z","title":"Yuan Yao, Tianyu Yu, Ao Zhang, Chongyi Wang, Junbo Cui, Hongji Zhu, Tianchi Cai, Haoyu Li, Weilin Zhao, Zhihui He, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20460","last_updated":"2026-05-15T03:02:09Z","snapshot_observed_at":"2026-08-02T13:57:28.162626Z","submitted_at":"2026-05-15T03:02:09Z","title":"Instruct-FD: Can Your Full-Duplex Speech System Follow Turn-Taking Instructions?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T13:57:31.306452Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2607.20460"},"observation_digest":"sha256:1725b28ee0eb1da92f0cb490a6c5f842c2318f61b1d8a8723eb49fa06258aa48","observation_id":"b000e732-f9cf-4a4f-9c51-3b275345b487","resolution":{"observed_at":"2026-08-02T13:57:31.306452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-03T13:16:11.540208Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen LLM,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29125","last_updated":"2026-07-31T07:56:25Z","snapshot_observed_at":"2026-08-09T01:08:25.454455Z","submitted_at":"2026-07-31T07:56:25Z","title":"M3-DuplexBench: A Multi-Turn, Multilingual, Multidomain Benchmark for Full-Duplex Spoken Dialogue Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T13:16:11.540208Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2607.29125"},"observation_digest":"sha256:6f39d006c464731ef2f06413a48bed84bcff385b138725a24050a012af91415a","observation_id":"b26e331d-2228-47ad-a1d3-b11dd57b5500","resolution":{"observed_at":"2026-08-03T13:16:11.540208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-06T00:30:10.821180Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm.arXiv preprint arXiv:2411.00774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01119","last_updated":"2026-08-02T09:27:51Z","snapshot_observed_at":"2026-08-06T23:25:36.518484Z","submitted_at":"2026-08-02T09:27:51Z","title":"JoyAI-Talker: Full-Duplex Speech Interactive Large Model Built for Empathetic Voice Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:30:10.821180Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2608.01119"},"observation_digest":"sha256:563d2fc59b33e510c41ff4173be5ac4488aa82f1e9b6050bf1ea62f23bc6410f","observation_id":"52398a3e-4123-4ff3-866e-7a4699707149","resolution":{"observed_at":"2026-08-06T00:30:10.821180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.00774/citation-record","integrity":"/paper/2411.00774/integrity","json":"/paper/2411.00774/citation-record.json","paper":"/paper/2411.00774"},"outbound":[],"paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","latest_version":5,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2411.00774."}