{"as_of":"2026-08-19T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ceebeb4f9ef0f801ad4e10d09e17fba31dfb13870bc67110817da2aa60535e8","coverage":[{"denominator":258,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:13:57.494016Z","state":"measured"},{"denominator":147,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":147,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":47,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:52:07.865325Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-11T21:12:24.013748Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04917","last_updated":"2024-12-06T10:16:04Z","snapshot_observed_at":"2026-08-15T20:01:57.260149Z","submitted_at":"2024-12-06T10:16:04Z","title":"Continuous Speech Tokens Makes LLMs Robust Multi-Modality Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:12:24.013748Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2412.04917"},"observation_digest":"sha256:d2d911cb5d3ed5331e842cafe6179bdcdec4569c8fcc379d843146ff73c8ed13","observation_id":"a03dbb64-8ad8-47ff-8b52-f7946be435e7","resolution":{"observed_at":"2026-08-11T21:12:24.013748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-11T11:18:39.935097Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15649","last_updated":"2024-12-20T08:05:55Z","snapshot_observed_at":"2026-08-12T05:23:04.133755Z","submitted_at":"2024-12-20T08:05:55Z","title":"SLAM-Omni: Timbre-Controllable Voice Interaction System with Single-Stage Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:39.935097Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2412.15649"},"observation_digest":"sha256:71e8e2d2da4a04e24572cfc2c315cdf8143ecd5fd33dd3c65cc2ec83242b5eff","observation_id":"85f77c63-dc55-4ddb-942b-4ab0570238d1","resolution":{"observed_at":"2026-08-11T11:18:39.935097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T22:40:25.442576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01034","last_updated":"2025-01-11T03:47:08Z","snapshot_observed_at":"2026-08-14T10:48:07.529275Z","submitted_at":"2025-01-02T03:28:52Z","title":"Advancing Singlish Understanding: Bridging the Gap with Datasets and Multimodal Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:40:25.442576Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.01034"},"observation_digest":"sha256:a1959a02eecbc97ce50ebd737514cce0c1e7fcbedbee0897f031701b2a39f053","observation_id":"c9d119e6-23bf-4caf-a8a9-8ff3c6c41e7c","resolution":{"observed_at":"2026-08-10T22:40:25.442576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T22:32:04.952630Z","title":"20 Preprint version Kristina Jokinen and Michael McTear","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01384","last_updated":"2025-01-02T17:58:23Z","snapshot_observed_at":"2026-08-15T12:28:28.005906Z","submitted_at":"2025-01-02T17:58:23Z","title":"OmniChat: Enhancing Spoken Dialogue Systems with Scalable Synthetic Data for Diverse Scenarios","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:32:04.952630Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.01384"},"observation_digest":"sha256:d19958e88a2f48001425d7a5044c75f07a4e05f7acb50f92ee3a489ab12adbff","observation_id":"ac489d20-9269-4d47-9b1f-015ee9aef61b","resolution":{"observed_at":"2026-08-10T22:32:04.952630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T21:10:56.898917Z","title":"MELD : A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T21:10:56.898917Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.06282"},"observation_digest":"sha256:588a6eeb8b61745bd7349435bf046cea38e68081e7805f04198d6ed0dbd9ceb2","observation_id":"8cae7078-9d07-49f5-b004-9cd8c21c982b","resolution":{"observed_at":"2026-08-10T21:10:56.898917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T14:36:19.156715Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-14T01:27:57.341623Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.156715Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:d676ff0efedcb88dc3baf120a5d9fe4125c97c58492362aeaec23342e22451a4","observation_id":"a5207cc1-6394-4a24-acb1-e3f238b866c6","resolution":{"observed_at":"2026-08-10T14:36:19.156715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-10T13:34:25.670790Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16327","last_updated":"2025-01-27T18:59:51Z","snapshot_observed_at":"2026-08-12T15:20:37.673304Z","submitted_at":"2025-01-27T18:59:51Z","title":"LUCY: Linguistic Understanding and Control Yielding Early Stage of Her","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:34:25.670790Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2501.16327"},"observation_digest":"sha256:810d316df3d5bf989e2fa3cad80a75cae574de6c4e6c4949993c8d890278c1bb","observation_id":"30ec01bb-3d89-4e32-b02f-f0bc7006d77e","resolution":{"observed_at":"2026-08-10T13:34:25.670790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-08-14T11:32:49.145887Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:7324c6c42c3d4072319389585fe0c907f23b89950aa66d04cb2a7fd1de3201eb","observation_id":"d76f053a-4f51-44c6-9c0d-6b8f7b739e43","resolution":{"observed_at":"2026-05-22T20:45:08.048139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-16T00:52:07.865325Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02625","last_updated":"2025-05-05T12:53:09Z","snapshot_observed_at":"2026-08-19T05:24:27.742624Z","submitted_at":"2025-05-05T12:53:09Z","title":"LLaMA-Omni2: LLM-based Real-time Spoken Chatbot with Autoregressive Streaming Speech Synthesis","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T00:52:07.865325Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.02625"},"observation_digest":"sha256:bc436c78f73fd7d6bb0a80dfcb520d3fbdf097f9dbfb5d5715aaeacb97aa0c75","observation_id":"ffc30f93-d563-4ea0-9351-857f2670ad54","resolution":{"observed_at":"2026-08-16T00:52:07.865325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T15:41:00.748722Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14356","last_updated":"2025-05-20T13:41:32Z","snapshot_observed_at":"2026-08-16T04:50:52.929035Z","submitted_at":"2025-05-20T13:41:32Z","title":"PersonaTAB: Predicting Personality Traits using Textual, Acoustic, and Behavioral Cues in Fully-Duplex Speech Dialogs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:41:00.748722Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.14356"},"observation_digest":"sha256:55c82a43dc3b0a1c99d6e97beff1176a5cdebc42b99589b21ed5ac5ee1b8afda","observation_id":"fd7ba0be-36c5-4455-8098-6c4bf2e123b0","resolution":{"observed_at":"2026-08-07T15:41:00.748722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T14:51:15.917688Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-17T02:24:20.568852Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:15.917688Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:52ecade508fea6395b27c8df91c19b90c43ce62ad03ec858602d970f770c8bae","observation_id":"24297cbb-faa3-4c2a-a25a-9cf84fe8d9b4","resolution":{"observed_at":"2026-08-07T14:51:15.917688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T14:25:09.865471Z","title":"WavChat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19179","last_updated":"2025-05-25T14:57:57Z","snapshot_observed_at":"2026-08-17T18:12:40.648036Z","submitted_at":"2025-05-25T14:57:57Z","title":"BR-ASR: Efficient and Scalable Bias Retrieval Framework for Contextual Biasing ASR in Speech LLM","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:09.865471Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2505.19179"},"observation_digest":"sha256:e6d260c806f5ac057a0214d24e25eac36ed43637bc7189fa7a8aaaec956ec2df","observation_id":"4c3dccc7-2e75-4285-ad77-48527129a280","resolution":{"observed_at":"2026-08-07T14:25:09.865471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T11:28:51.286122Z","title":"Wavchat: A survey of spoken dialogue models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-13T12:54:08.987275Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:51.286122Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:4298f353ce4ce9e4b0172141ff9da61bc1d65fe9a848435a6ad5a14767fa95f7","observation_id":"b3c742b7-aa8e-4ea6-b906-76cf35b79278","resolution":{"observed_at":"2026-08-07T11:28:51.286122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:47:11.320572Z","title":"WavChat: A Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-15T10:49:12.446314Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:11.320572Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:1501e1d990b4d927b4e900badadf1292506ee1a4e9724f3668abeaeee049226d","observation_id":"44080555-c607-49e4-a760-a70df34c9de0","resolution":{"observed_at":"2026-08-07T05:47:11.320572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:03:13.393147Z","title":"Wavchat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-15T16:35:33.798128Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.393147Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:bc7ca2ad6ebc7331c559d4ab49b79add731d72530167ceddd42837af371f14ea","observation_id":"681a5cdb-7ba7-4382-9e1f-b936d7d04130","resolution":{"observed_at":"2026-08-07T05:03:13.393147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T23:35:36.084747Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-10T07:54:14.180718Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.084747Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:06d0542b6b4735f84155851d9cf1b5863dee308ea42e7e4b4f47108df30cc057","observation_id":"b65c5f37-2a5f-4cad-b67c-2cbb5e689769","resolution":{"observed_at":"2026-08-06T23:35:36.084747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2506.18962","last_updated":"2026-05-11T09:01:24Z","snapshot_observed_at":"2026-08-06T06:40:03.304790Z","submitted_at":"2025-06-23T17:58:17Z","title":"UniMind: Unleashing the Power of LLMs for Unified Multi-Task Brain Decoding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-19T07:43:26.736409Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.18962"},"observation_digest":"sha256:182754d0dc713b51c7a602f6255682917bba17ff3e584b2e31f8e5cf91793c18","observation_id":"ae0594c1-2ab7-40ed-84a5-211ae59b4860","resolution":{"observed_at":"2026-05-19T07:47:10.364647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T21:33:09.245104Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23986","last_updated":"2025-07-01T16:23:28Z","snapshot_observed_at":"2026-08-12T19:20:22.783897Z","submitted_at":"2025-06-30T15:50:08Z","title":"StreamFlow: Streaming Flow Matching with Block-wise Guided Attention Mask for Speech Token Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:33:09.245104Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.23986"},"observation_digest":"sha256:b93d215d0a942b43c3a96ab743b44b38af00788a3c04db94ee42d192c43fd215","observation_id":"8c503e55-8ba0-4943-9f41-c006f5503240","resolution":{"observed_at":"2026-08-06T21:33:09.245104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-06T16:11:24.285128Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14346","last_updated":"2025-07-18T19:51:56Z","snapshot_observed_at":"2026-08-17T01:53:21.808406Z","submitted_at":"2025-07-18T19:51:56Z","title":"Towards Accurate Phonetic Error Detection Through Phoneme Similarity Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:11:24.285128Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2507.14346"},"observation_digest":"sha256:c6d386c9da76e8e808d51b2683b84100003d3bc9274b2be441cbee961b28f2e3","observation_id":"f140ba98-4637-4a27-b434-b70b112dc254","resolution":{"observed_at":"2026-08-06T16:11:24.285128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T21:45:22.176873Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08095","last_updated":"2025-08-11T15:33:44Z","snapshot_observed_at":"2026-08-15T04:15:26.127366Z","submitted_at":"2025-08-11T15:33:44Z","title":"Dual Information Speech Language Models for Emotional Conversations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:45:22.176873Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2508.08095"},"observation_digest":"sha256:26a27a0be410d1fe740777963088b3fe8b8b87318edfdc41f261372f9f97b30b","observation_id":"74403b0a-948f-405d-9850-ed7df164adbb","resolution":{"observed_at":"2026-08-05T21:45:22.176873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T16:46:49.184979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-19T07:28:18.323041Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:49.184979Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:5cffd73de78717182699ba5e870a90de6591d2e000e7d5a76b9388415a8c646b","observation_id":"5288e3c4-2220-4f74-bd8a-ccf2e787a69d","resolution":{"observed_at":"2026-08-05T16:46:49.184979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T15:52:44.007778Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00078","last_updated":"2025-08-26T20:40:24Z","snapshot_observed_at":"2026-08-17T01:55:32.515110Z","submitted_at":"2025-08-26T20:40:24Z","title":"ChipChat: Low-Latency Cascaded Conversational Agent in MLX","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:44.007778Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2509.00078"},"observation_digest":"sha256:5bd03cdd0f5aac6743d3fa6adee807e237ac6af484a2459904ca7fe8b36893d1","observation_id":"9f744dbb-9fdf-44a8-9b65-209172234df5","resolution":{"observed_at":"2026-08-05T15:52:44.007778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:0f382f6e8fde6d92bedc0ad7e909db75dc2a79aff83209b9cc5b69314d0d4ac1","observation_id":"ab9084d7-ed4c-4928-add3-05e6c2c8fd8c","resolution":{"observed_at":"2026-05-18T11:52:35.726992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-03T21:42:49.032029Z","title":"WavChat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-17T20:53:08.632103Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:49.032029Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:8fa22bfaf0b2d21d551c402379b27511e933f1b0cb925e954cd011364739927c","observation_id":"b19cbf1b-6668-4905-b09c-0e80e2297a68","resolution":{"observed_at":"2026-08-03T21:42:49.032029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2603.22267","last_updated":"2026-05-13T14:33:44Z","snapshot_observed_at":"2026-08-17T23:10:58.941065Z","submitted_at":"2026-03-23T17:51:40Z","title":"TiCo: Time-Controllable Spoken Dialogue Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:52.182973Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2603.22267"},"observation_digest":"sha256:7687fb09d1bd2ef121c8afb9f32362162a0f65d3b46a803c4e5d9eb603c557d5","observation_id":"271fc78e-d208-4431-9e80-c67457bd918e","resolution":{"observed_at":"2026-05-15T00:39:35.866368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"WavChat: a Survey of Spoken Dialogue Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:bff2c9726e041b49d80107c40b8d22898359ff13214b5796978874efed06ae6d","observation_id":"535b2d08-65a5-4aa4-ba7a-7e720b089a69","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-11T08:37:21.535936Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:c49013faeaa7841b4636d6e45a12dba5a660061854ba81a9c4808916602d958a","observation_id":"7bd73e9c-b565-485d-acf0-d87c0ab92ffc","resolution":{"observed_at":"2026-05-10T11:35:18.904751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.19245","last_updated":"2026-04-22T07:02:47Z","snapshot_observed_at":"2026-08-10T23:11:09.515213Z","submitted_at":"2026-04-21T08:50:50Z","title":"Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T02:18:07.162514Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.19245"},"observation_digest":"sha256:6d3cefc82f4d0fcb6b5f25277f84ddd6860afd19360481145faa68ba324247ce","observation_id":"8ea7f99f-86af-441f-a610-0d9a707b88a3","resolution":{"observed_at":"2026-05-10T02:22:21.217967Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2604.25591","last_updated":"2026-04-28T12:56:22Z","snapshot_observed_at":"2026-08-11T04:21:44.774351Z","submitted_at":"2026-04-28T12:56:22Z","title":"Walking Through Uncertainty: An Empirical Study of Uncertainty Estimation for Audio-Aware Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-07T14:29:18.348031Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2604.25591"},"observation_digest":"sha256:b6566247bdfe5679372c214be7566ed003fdbb4d9969ac847d0c82d0f37a0746","observation_id":"e8014a72-e25e-48c7-9938-bfde1e7c5e27","resolution":{"observed_at":"2026-05-12T00:41:26.363121Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.04613","last_updated":"2026-05-06T08:03:31Z","snapshot_observed_at":"2026-08-11T12:53:06.596504Z","submitted_at":"2026-05-06T08:03:31Z","title":"VocalParse: Towards Unified and Scalable Singing Voice Transcription with Large Audio Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-08T16:59:25.973854Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.04613"},"observation_digest":"sha256:64a1a09071da6686a24e5da5c28e0207eb91abc3dea61d850ec61bdc9f0b325f","observation_id":"6de18e82-e85e-4747-9da7-4f588149be8f","resolution":{"observed_at":"2026-05-11T17:51:09.764621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-11T13:23:12.680939Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:bddc55f47bde2ecac6fed111344cf29a69ef8a2f5d82b6c5f09541e3367257fe","observation_id":"36ee66e8-0806-429d-94e4-0367b3d78a91","resolution":{"observed_at":"2026-05-11T04:50:55.760212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.17443","last_updated":"2026-08-18T05:19:14Z","snapshot_observed_at":"2026-08-19T11:20:58.094183Z","submitted_at":"2026-05-17T13:29:15Z","title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T13:02:53.960375Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.17443"},"observation_digest":"sha256:5a9ad29997a39f361f46d7e49a6d2cab9732249021b4c2a85a53fa12d7c58a07","observation_id":"7a2fed10-bd5c-417e-bed0-684bfb935262","resolution":{"observed_at":"2026-05-20T13:03:17.758837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.17443","last_updated":"2026-08-18T05:19:14Z","snapshot_observed_at":"2026-08-19T11:20:58.094183Z","submitted_at":"2026-05-17T13:29:15Z","title":"Analyzing Error Propagation in Korean Spoken QA with ASR-LLM Cascades","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T19:12:32.672352Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.17443"},"observation_digest":"sha256:a0e86316a6685323a2934e20d16fb3acf96190fa53ed651ddd2555b3d44ff922","observation_id":"6d257d6d-1135-4f57-aec4-5ffc20237160","resolution":{"observed_at":"2026-06-30T19:15:00.392581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-16T00:00:14.809961Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:b4db93e878ac2de73b9592582041a1bc898697e08f37e5d63b67c2423fda004e","observation_id":"3e1a5b93-42aa-42d3-b65a-0f686d7bb436","resolution":{"observed_at":"2026-05-21T07:39:49.050610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-08-19T11:22:36.938770Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:65ee0035ce278227cb9652d7923cc39b85cf0ad667edc155e525d4f536f19994","observation_id":"292c42a6-2bcc-4fdc-b4d3-5472e442d172","resolution":{"observed_at":"2026-07-01T20:46:13.838719Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.01677","last_updated":"2026-06-01T04:35:28Z","snapshot_observed_at":"2026-08-15T20:44:10.931817Z","submitted_at":"2026-06-01T04:35:28Z","title":"UniVocal: Unified Speech-Singing Code-Switching Synthesis","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-28T13:17:13.510587Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.01677"},"observation_digest":"sha256:1f8334f08b6d30fab1a3e9906bf8d916e2f07e63b88e0153f0a8e9a0ba7acde1","observation_id":"56dd88e1-fd28-4878-aafe-63dad0995384","resolution":{"observed_at":"2026-07-02T00:46:24.646473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:10070c0d317729bffd755ec53c20d7d74a25ba944958e1c9ce3768fbbe4360fa","observation_id":"9e561681-2cfb-4359-be47-55f7f9d8f1e8","resolution":{"observed_at":"2026-06-27T13:20:57.380720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.11386","last_updated":"2026-06-09T19:08:07Z","snapshot_observed_at":"2026-08-15T06:53:04.268425Z","submitted_at":"2026-06-09T19:08:07Z","title":"Overcoming State Inertia in Full-Duplex Spoken Language Models via Activation Steering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:22:52.428152Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.11386"},"observation_digest":"sha256:8d64f3abc8a0646a459c700deb9adefae839adf8bbfcabbedd0de9c3117cabbb","observation_id":"5615766a-21f1-4d73-8a28-d4a93a13076e","resolution":{"observed_at":"2026-07-03T05:07:39.504681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.12902","last_updated":"2026-06-11T04:59:33Z","snapshot_observed_at":"2026-08-06T20:56:40.382372Z","submitted_at":"2026-06-11T04:59:33Z","title":"PRISM: Prosody-Integrated Multi-Agent Reasoning Framework for Empathetic Spoken Dialogue","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:53:13.344795Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.12902"},"observation_digest":"sha256:ace794eb05500aca914450dcce1ada504695c4b88f5d90a420ec95b3c135ac67","observation_id":"fc803355-0644-4879-9499-af55bdc620cc","resolution":{"observed_at":"2026-07-03T14:48:33.547578Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.21970","last_updated":"2026-06-20T09:59:34Z","snapshot_observed_at":"2026-08-14T11:33:43.297858Z","submitted_at":"2026-06-20T09:59:34Z","title":"Integrating Facial Generation into Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T12:08:55.070482Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.21970"},"observation_digest":"sha256:33e467f34ea4b22521d8b2872450cd6d002524b1c7e4e93d8adb1008b9eab0a1","observation_id":"0a6e3651-30ce-49cd-a0a5-a1d5c29ac73a","resolution":{"observed_at":"2026-07-04T08:09:41.319388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.23139","last_updated":"2026-06-22T10:32:25Z","snapshot_observed_at":"2026-08-18T07:30:52.697166Z","submitted_at":"2026-06-22T10:32:25Z","title":"Audio Editing in the Era of Foundation Models: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T07:10:49.047784Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.23139"},"observation_digest":"sha256:376696f9c46eaa997c8f6c1c6c4b0fe3316732a2c975d5cbe5705d3fffb5c7dc","observation_id":"5bff76c7-2b3a-478d-bc3e-aaf2a390e528","resolution":{"observed_at":"2026-07-04T12:09:49.441309Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2606.26968","last_updated":"2026-06-25T12:40:39Z","snapshot_observed_at":"2026-08-14T12:28:23.502257Z","submitted_at":"2026-06-25T12:40:39Z","title":"RedVox: Safety and Fairness Gaps in Speech Models Across Languages","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-26T04:37:00.399470Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2606.26968"},"observation_digest":"sha256:76e0b0d65e81ceb228da25afed101a30572a7a166da40aa535194caa5b729599","observation_id":"c068f586-cd16-4bd7-9cdb-a91e167203ce","resolution":{"observed_at":"2026-07-04T13:59:52.893021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-08-14T10:16:36.384280Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T21:22:38.888528Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:2f494d396cd696cb5e940d227901fe7526d688a02f7a21f409f701602b095b71","observation_id":"16ed510f-853e-45a6-b971-8f702480c31a","resolution":{"observed_at":"2026-07-03T21:28:58.297693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-07-12T08:53:13.408944Z","title":"Wavchat: A survey of spoken dialogue models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-08-14T10:16:36.384280Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T08:53:13.408944Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:10f077db3ab69ad930065ae5e20e9d6aee24ef3f9193a6dae12d0fd09a773229","observation_id":"1aacc01f-e37b-4fce-9c64-46d6f0f3761f","resolution":{"observed_at":"2026-07-12T08:53:13.408944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":"2411.13577","doi":"10.48550/arxiv.2411.13577","metadata_source":"pith","pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WavChat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577","venue":"eess.AS","work_id":"3e856eda-dc15-4393-81a6-064114906c75","year":2024},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-14T20:31:36.453957Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:0b2fa312c3d37ca864a980c8c307b0d0bd8b8f8ec87f7be26e433c862020fd65","observation_id":"b65231ce-691f-49ab-bddc-1b16309664a0","resolution":{"observed_at":"2026-07-08T02:44:27.611257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:53.17237+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-01T07:12:17.646123Z","title":"arXiv preprint arXiv:2411.13577 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-15T07:33:56.279411Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":131,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.646123Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:837d942059344b9d72b8ae890bfe6bb2605e23feed9e4b2ab1b842fcc235554b","observation_id":"26ce0f7a-9521-40c9-a8ca-99e9b2e5484c","resolution":{"observed_at":"2026-08-01T07:12:17.646123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-14T04:35:59.509929Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08569","last_updated":"2026-08-09T08:17:18Z","snapshot_observed_at":"2026-08-18T05:00:28.829626Z","submitted_at":"2026-08-09T08:17:18Z","title":"VoxZip: Semantic-Anchored Temporal KV Cache Compression for Long-Context Audio Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:35:59.509929Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2608.08569"},"observation_digest":"sha256:82c0ab442e58b9782a804d7a95fa6b2342afbb41c2aadb5e254c952998eff44b","observation_id":"773619b2-f9bc-4a5f-aa97-df3bf5dc5ab0","resolution":{"observed_at":"2026-08-14T04:35:59.509929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13577/citation-record","integrity":"/paper/2411.13577/integrity","json":"/paper/2411.13577/citation-record.json","paper":"/paper/2411.13577"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T20:13:56.957483Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.957483Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6caabafabcf3ac01c942a84b64c98b0f79bd3d10004d448d99a4838ced3dc25a","observation_id":"9c26b626-7630-461b-a1f5-3fe009b28cd0","resolution":{"observed_at":"2026-08-12T20:13:56.957483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-17T00:33:41.369960Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-12T20:13:56.962819Z","title":"Musiclm: Generating music from text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.962819Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:b86cd07f0a340f33e8ea9f432730d2d712d0bfc22e6adfbf180aaac97bb310a1","observation_id":"e9c2d8f8-9a71-4eab-b4b4-1096737dc39c","resolution":{"observed_at":"2026-08-12T20:13:56.962819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04752","last_updated":"2024-09-24T07:40:54Z","snapshot_observed_at":"2026-08-16T13:54:29.322425Z","submitted_at":"2024-05-08T01:40:13Z","title":"HILCodec: High-Fidelity and Lightweight Neural Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04752","snapshot_observed_at":"2026-08-12T20:13:56.968238Z","title":"Hilcodec: High fidelity and lightweight neural audio codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.968238Z"},"links":{"cited_paper":"/paper/2405.04752","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:b207fd44162494e070a1f1974731737ff1fb00b53b62342900b5a2503f823531","observation_id":"4ecaa38d-9edb-4a0e-9628-3526b7d01beb","resolution":{"observed_at":"2026-08-12T20:13:56.968238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10533","last_updated":"2024-09-24T01:14:07Z","snapshot_observed_at":"2026-08-16T14:18:03.588339Z","submitted_at":"2024-02-16T09:38:16Z","title":"APCodec: A Neural Audio Codec with Parallel Amplitude and Phase Spectrum Encoding and Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10533","snapshot_observed_at":"2026-08-12T20:13:56.974234Z","title":"Apcodec: A neural audio codec with parallel amplitude and phase spectrum encoding and decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.974234Z"},"links":{"cited_paper":"/paper/2402.10533","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e6951398431fc293acc29f60cc2b9496a3129994c48231755b83e7f508f1d802","observation_id":"002ca7ce-610f-4862-a914-196ffd609c03","resolution":{"observed_at":"2026-08-12T20:13:56.974234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-12T20:13:56.979573Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.979573Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:909d2a92fbee0260853595b958f57507c496060e3421306b5b102d38ffe997e5","observation_id":"ea9d8ba8-8bc2-43ed-b261-2854fb0377fc","resolution":{"observed_at":"2026-08-12T20:13:56.979573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-12T20:13:56.985115Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.985115Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:034f2df5092e1850dba5ccc587eb5b4acc3b06c62a2de7d51a7912c8ae5b31f4","observation_id":"2d0a9442-fe6d-4354-83fb-95ad0a456654","resolution":{"observed_at":"2026-08-12T20:13:56.985115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13340","last_updated":"2025-01-16T08:34:36Z","snapshot_observed_at":"2026-08-16T13:41:32.795501Z","submitted_at":"2024-06-19T08:46:29Z","title":"SD-Eval: A Benchmark Dataset for Spoken Dialogue Understanding Beyond Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13340","snapshot_observed_at":"2026-08-12T20:13:56.991259Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understand- ing beyond words","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.991259Z"},"links":{"cited_paper":"/paper/2406.13340","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:fa533523ec6c352aac1320aa960ba43a00e358cf51fe2c19eed9c64c7478b192","observation_id":"b7b9cc61-d310-4e55-9554-f66189e4215b","resolution":{"observed_at":"2026-08-12T20:13:56.991259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-12T20:13:56.996509Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:56.996509Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:31641c6ea377a6b0793a8b4133ab1d0ca7c30e2617142ca4f854c5450ef05737","observation_id":"956ed686-9594-4924-b517-422a317da9f2","resolution":{"observed_at":"2026-08-12T20:13:56.996509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-16T17:41:05.963766Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-12T20:13:57.001454Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.001454Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:2f13f94ef39cfb102f03ffb40764aec89e9f65a462151a081f5cf42d692667f9","observation_id":"a393ab7b-61a5-490b-98a7-7beda0ca40bf","resolution":{"observed_at":"2026-08-12T20:13:57.001454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.007075Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.007075Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:262ea28a063c1f6c3018a0b6b4adf95ee53882ffe0dc7f3062a6edbaa3ae0b0e","observation_id":"3e28eb88-9e4c-4b9f-9016-4a6e2e8443a8","resolution":{"observed_at":"2026-08-12T20:13:57.007075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-12T20:13:57.012278Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.012278Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8265e2f7f2269f57e0d600673491cf5c3bc3bfcf22b0788f5c288a845a5c27da","observation_id":"315dc7ec-e5eb-4f92-b4a9-501bac386e64","resolution":{"observed_at":"2026-08-12T20:13:57.012278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-08-13T10:37:24.864456Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-12T20:13:57.017135Z","title":"An empirical evaluation of generic convo- lutional and recurrent networks for sequence modeling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.017135Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:5981e5c62d5badd1b0de1321874e4642a5add0e95100a26921d11759b0c270d6","observation_id":"b4a12570-d991-47bd-bf60-b71f05c3238b","resolution":{"observed_at":"2026-08-12T20:13:57.017135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.021600Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.021600Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3872e85cef5dec94ebeb5996a8518393e38e7087bf63d6ac40c832b9261fda74","observation_id":"76dcd302-7a21-4582-a493-5dc93222cddd","resolution":{"observed_at":"2026-08-12T20:13:57.021600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-17T17:18:07.224353Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-12T20:13:57.026191Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.026191Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:ad33c1774a7a8251526415502e8d2e1c41520f716b001abb005e13732769d1c9","observation_id":"e6800971-c408-481c-8671-963e5dd4fe91","resolution":{"observed_at":"2026-08-12T20:13:57.026191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.030773Z","title":"Curriculum learning","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.030773Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:c0a71cca1b8de2ba4b4e8f49c4f46215b6ca969d9fadf6673879b7ccaf889fa1","observation_id":"1daf4044-5c06-4330-8d8f-c482137b6063","resolution":{"observed_at":"2026-08-12T20:13:57.030773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.035011Z","title":"Medleydb: A multitrack dataset for annotation-intensive mir research","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.035011Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:42ce2528f01c0fded2486fa66965a3b71d0fe478b25b03d65158e6a364ce847a","observation_id":"dab89427-e657-4506-9ccc-2cebbf9860b7","resolution":{"observed_at":"2026-08-12T20:13:57.035011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.039424Z","title":"A comparison of sound segregation techniques for predominant instrument recognition in musical audio signals","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.039424Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e70a6ff62acfd60d38555157581ab75b3321da449fffbe994fc0144bf89c10f7","observation_id":"d2af126a-f211-4433-8a83-ed71a03ba5d4","resolution":{"observed_at":"2026-08-12T20:13:57.039424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.043938Z","title":"Aishell-1: An open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.043938Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:65796f3e29f04911b1dda0da62827ec84536c4d7e09cd7567ad679097de7f40d","observation_id":"4765c84f-026a-49d4-966a-021719ab9b7e","resolution":{"observed_at":"2026-08-12T20:13:57.043938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.048395Z","title":"Iemocap: Interactive emotional dyadic motion capture database","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.048395Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:01dbdbed49027603b5841c2ecb080e9d320631aa2a0b301bbc6c3f07a29d4e14","observation_id":"258ccbfc-8bbf-4433-b616-92d0b2f50e44","resolution":{"observed_at":"2026-08-12T20:13:57.048395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.053955Z","title":"Msp-improv: An acted corpus of dyadic interactions to study emotion perception","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.053955Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:b05a50d4887d15fb22689bb4207c5473b17447564c2828899d759d5ffb5bccea","observation_id":"d2fb2d2e-336a-42d4-bf86-be0f562b8128","resolution":{"observed_at":"2026-08-12T20:13:57.053955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-19T07:35:38.988501Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-12T20:13:57.058757Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.058757Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:9f0e06ac947954ecc0e74fc18cc6198294114299c6d3ad2f21ea203fa2621cfb","observation_id":"3b44d82e-5b4b-41e4-b5dc-22689577b166","resolution":{"observed_at":"2026-08-12T20:13:57.058757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T20:13:57.063979Z","title":"Albert q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.063979Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6b61a39ce70fb7bec21da36f74e49eae6aceb3190e43a6227029699d6ffef0f3","observation_id":"018c40ae-3892-4bec-b1e2-e4c4d8558bbc","resolution":{"observed_at":"2026-08-12T20:13:57.063979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-16T13:47:03.288626Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-12T20:13:57.069312Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.069312Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:d3cbca9b29a5e39bca405ec0a2fe76d35c17f42f4510aca3275b30fd5cfd3cbe","observation_id":"ceeb780d-66d9-4dca-a1e0-b4cfcddc395c","resolution":{"observed_at":"2026-08-12T20:13:57.069312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-16T18:17:33.981607Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-12T20:13:57.074793Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.074793Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e36c9dbe81b6c5376de315dde30aea8bef32d404b9eb53aac3cbb4e45c37a745","observation_id":"4db6cd1f-8b9a-4688-a0af-bcaaf51a1b75","resolution":{"observed_at":"2026-08-12T20:13:57.074793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18042","last_updated":"2025-03-20T08:47:39Z","snapshot_observed_at":"2026-08-16T13:15:03.146180Z","submitted_at":"2024-09-26T16:44:02Z","title":"EMOVA: Empowering Language Models to See, Hear and Speak with Vivid Emotions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18042","snapshot_observed_at":"2026-08-12T20:13:57.080098Z","title":"Emova: Empowering language models to see, hear and speak with vivid emotions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.080098Z"},"links":{"cited_paper":"/paper/2409.18042","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:1ce8fd5441e1ec740ba53af26926c9755ffc6609a08f2681461402473f8cf1b0","observation_id":"c02b3be4-debd-4f67-8ee1-6d6aa4965463","resolution":{"observed_at":"2026-08-12T20:13:57.080098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-12T20:13:57.085035Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.085035Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e61b93f11c91036f8fdc7b9136578b025660f213687aa41f324c138cdfe50a72","observation_id":"3f7b9dba-156d-462e-9bf3-948ea0e899da","resolution":{"observed_at":"2026-08-12T20:13:57.085035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.090451Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.090451Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:d8c700b214949e7861dbe900f95e304520fc5ca320f6dc9fc609f266dff709ce","observation_id":"c2a1efb3-59e4-437e-ae96-2947bae9c2b3","resolution":{"observed_at":"2026-08-12T20:13:57.090451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-16T16:07:52.895019Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-12T20:13:57.096118Z","title":"Beats: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.096118Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:56fff983b9d267d2635c26922cb91d54a9af4d983770c328c84a250b9de38e79","observation_id":"7df371f9-bab8-4f0b-931c-14d381ef70e5","resolution":{"observed_at":"2026-08-12T20:13:57.096118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-08-17T12:45:25.032324Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-12T20:13:57.101245Z","title":"V oicebench: Benchmarking llm-based voice assistants","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.101245Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8164571ce2349d41fa5d47c117e6370761703dd22ca25bf49d0dbe111bd44c35","observation_id":"5b47d8fc-ad34-4938-87f1-403ed37ecbb8","resolution":{"observed_at":"2026-08-12T20:13:57.101245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-12T20:13:57.106570Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.106570Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:9df9b55bda2279901635b94063b027bd8be9e305a984c0a08fab18f70652c6f8","observation_id":"8c645ca3-7c0a-47bc-a393-ef41920af236","resolution":{"observed_at":"2026-08-12T20:13:57.106570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.110882Z","title":"Audio albert: A lite bert for self-supervised learning of audio representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.110882Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:73c6051000cb35dbd327656d12c2a0eda838368ed0a10746b2f1e233b2e87dce","observation_id":"ef5c41f2-bef0-43b9-8800-83c3b39d8a6a","resolution":{"observed_at":"2026-08-12T20:13:57.110882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12998","last_updated":"2024-12-14T18:40:28Z","snapshot_observed_at":"2026-08-16T13:41:42.345967Z","submitted_at":"2024-06-18T18:38:17Z","title":"Coding Speech through Vocal Tract Kinematics","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12998","snapshot_observed_at":"2026-08-12T20:13:57.114967Z","title":"Articulatory encodec: V ocal tract kinematics as a codec for speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.114967Z"},"links":{"cited_paper":"/paper/2406.12998","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:74ddd1c58a386ab6cae096b659fa0c5ea28738365c42ab8972f7b99c64c9d1d2","observation_id":"cac48763-3162-485f-909a-b2c4aed89fd4","resolution":{"observed_at":"2026-08-12T20:13:57.114967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-12T20:13:57.120817Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.120817Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:71513bb77b6e0e05049d44f390ceea88ad5b9d5c0705811c42576da27237b432","observation_id":"c593901c-4945-49fb-aee4-e89607ae5845","resolution":{"observed_at":"2026-08-12T20:13:57.120817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-12T20:13:57.125555Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.125555Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:379e80f1771fc73c4821d8d3cfd43d7111843adbb83a3f346c19b778dff34367","observation_id":"cf343a91-b7a9-4c22-ad3d-d1e7b00db920","resolution":{"observed_at":"2026-08-12T20:13:57.125555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08392","last_updated":"2020-05-17T23:06:09Z","snapshot_observed_at":"2026-08-08T22:51:12.980192Z","submitted_at":"2020-05-17T23:06:09Z","title":"Vector-Quantized Autoregressive Predictive Coding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08392","snapshot_observed_at":"2026-08-12T20:13:57.130253Z","title":"Vector-quantized autoregressive predictive coding","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.130253Z"},"links":{"cited_paper":"/paper/2005.08392","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:c3ed9f133a6b78771226b37da56cb3bb701b30196cc6fb91e45f937e752ce0de","observation_id":"be047d4b-f468-479f-84da-bd1ead5288e8","resolution":{"observed_at":"2026-08-12T20:13:57.130253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04229","last_updated":"2024-02-06T18:36:52Z","snapshot_observed_at":"2026-08-16T14:20:53.897700Z","submitted_at":"2024-02-06T18:36:52Z","title":"MusicRL: Aligning Music Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04229","snapshot_observed_at":"2026-08-12T20:13:57.135983Z","title":"Musicrl: Aligning music generation to human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.135983Z"},"links":{"cited_paper":"/paper/2402.04229","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8aa3a7d25b9f11626f70793d7434dea419cb22a3bbbd865bd7b7879b8e1a0595","observation_id":"ed8bf43c-20bd-4ecf-a844-feff12ec830e","resolution":{"observed_at":"2026-08-12T20:13:57.135983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.141036Z","title":"The fisher corpus: A resource for the next generations of speech-to-text","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.141036Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:580e34c1db4771b90a95830d0c359d6f350d606c3e91d86b80eb6e5dcc1c9c52","observation_id":"ce81594f-53ac-49bc-acf0-c7e9a3e76d4c","resolution":{"observed_at":"2026-08-12T20:13:57.141036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-12T20:13:57.145838Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.145838Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:76db1171460e0497fc05d5141110f14db8749273b0e18ccbf8c84395b3552b24","observation_id":"c1da52ec-8c73-41a9-868d-68f46c881fcc","resolution":{"observed_at":"2026-08-12T20:13:57.145838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T20:13:57.150893Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.150893Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:a32ec8719724ce629c90c9fd2908553a92b2945bf49cf5e9a74859796d71907e","observation_id":"c28f2a5d-7bd0-4402-ac24-8f356ba2676b","resolution":{"observed_at":"2026-08-12T20:13:57.150893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.155813Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.155813Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:0cf30997392d5955715511589399db3fda3f18728b862ebada56ac89f273a163","observation_id":"62b36e97-f652-4c13-bb1d-f662964f8706","resolution":{"observed_at":"2026-08-12T20:13:57.155813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-12T20:13:57.160614Z","title":"Speechverse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.160614Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:f659444dd68d884ad97803b5476a80f862ca5ea2bbc908b1a31b00fe7a2a4215","observation_id":"4d1dd1b5-327b-4a08-8f2b-1ff04dd74303","resolution":{"observed_at":"2026-08-12T20:13:57.160614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.166013Z","title":"FMA: A dataset for music analysis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.166013Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:25047ec1c0ab066fdfa3f20316c55b460d1f5c3b7d9976eb0ed6493346057450","observation_id":"f6ec07a2-e710-4c85-902a-ca44a7fbba2b","resolution":{"observed_at":"2026-08-12T20:13:57.166013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T20:13:57.171080Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.171080Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:cf9fc8b2fdd64f63371b5623ffdb03f059b7d1555e02f5a5cef7495b54ac4982","observation_id":"a93b1fac-b5e3-48d3-8260-ea26665cacb8","resolution":{"observed_at":"2026-08-12T20:13:57.171080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-12T20:13:57.176108Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.176108Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:4b80ac63d98a572a170e32b5d47ebf3b6c6f667c1c4d5808fd27b3a891d364f1","observation_id":"29fb114e-c123-4060-8e32-bf2cf5c3210b","resolution":{"observed_at":"2026-08-12T20:13:57.176108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T20:13:57.181222Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.181222Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:eab519d53c5524e1c7bdd82744d54d4781f257e25f961a97b8f6fd6bf3ab428e","observation_id":"0cefef90-71e3-40e3-a52f-0be6618637f6","resolution":{"observed_at":"2026-08-12T20:13:57.181222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-12T20:13:57.186385Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.186385Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:98b5523bea90a829467878b84415ef3b1ec9754e820d8d3d814eb5e2a569c9ca","observation_id":"22a5a61f-24bb-4d91-9549-a875aab4479e","resolution":{"observed_at":"2026-08-12T20:13:57.186385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09283","last_updated":"2024-03-27T13:55:14Z","snapshot_observed_at":"2026-08-18T07:38:05.119659Z","submitted_at":"2024-02-14T16:14:03Z","title":"Attacks, Defenses and Evaluations for LLM Conversation Safety: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09283","snapshot_observed_at":"2026-08-12T20:13:57.190980Z","title":"Attacks, defenses and evaluations for llm conversation safety: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.190980Z"},"links":{"cited_paper":"/paper/2402.09283","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:ba4fe932954b014534b0beab16a8f088ede27d9565b23c473905a3be794ff888","observation_id":"2b4d91b7-1791-4e0c-8b0f-a307743f6348","resolution":{"observed_at":"2026-08-12T20:13:57.190980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-14T18:34:46.662561Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-12T20:13:57.195498Z","title":"Aishell-2: Transforming mandarin asr research into industrial scale","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.195498Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3315ce116afefc52c672a5644374426d9af012a53cd5cbdc11258759fddd9a9e","observation_id":"30ba73b8-d666-4736-81fb-0eb8a5cd1376","resolution":{"observed_at":"2026-08-12T20:13:57.195498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-12T20:13:57.200756Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.200756Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:29445ac00f7ddf91597f77571504c2c3c032594e4c8b5e725c8e1b304f806502","observation_id":"f9ce1a66-22c5-4ec6-b4da-662fd9ea569f","resolution":{"observed_at":"2026-08-12T20:13:57.200756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-16T14:54:18.806254Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-12T20:13:57.204938Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.204938Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:face3f1b8e5825e835f6cca4c5b7269468742bffe1b2c9818f9d04ba8c3ab7e3","observation_id":"5a316dd0-6089-4e12-b772-fe85c4600f4e","resolution":{"observed_at":"2026-08-12T20:13:57.204938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.209731Z","title":"Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.209731Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3176b1a933a51284527fb2b76316a8e192a3ff734543f257f433216e83238402","observation_id":"2f229422-b4d8-4554-8113-4f578c56de24","resolution":{"observed_at":"2026-08-12T20:13:57.209731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T20:13:57.214193Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.214193Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:f454349d69251e9d7a61fc1c510ee9db75a33a116066d4c71e89762c45355c23","observation_id":"bb83fbb4-cbb0-442d-94fa-42c7379c0d8b","resolution":{"observed_at":"2026-08-12T20:13:57.214193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.219888Z","title":"Some signals and rules for taking speaking turns in conversations","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.219888Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:10ab8f5eaa0561deee7d0434ad2cc3a8473d8e1306f6f431cdffeab51a0a52f0","observation_id":"40b767ac-f322-4d9e-983e-73d4f7a3b8d4","resolution":{"observed_at":"2026-08-12T20:13:57.219888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.224703Z","title":"On signalling that it’s your turn to speak","venue":null,"work_id":null,"year":1974},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.224703Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:80afbde879963a16cc04279588587c9aae537fe19c4e37fa4aac1f37f15b6aec","observation_id":"fcc02c13-c6d9-4d37-969e-037da153b3b7","resolution":{"observed_at":"2026-08-12T20:13:57.224703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10874","last_updated":"2020-10-21T09:58:39Z","snapshot_observed_at":"2026-08-17T23:11:22.399101Z","submitted_at":"2020-10-21T09:58:39Z","title":"TurnGPT: a Transformer-based Language Model for Predicting Turn-taking in Spoken Dialog","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.10874","snapshot_observed_at":"2026-08-12T20:13:57.229795Z","title":"Turngpt: a transformer-based language model for predicting turn-taking in spoken dialog","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.229795Z"},"links":{"cited_paper":"/paper/2010.10874","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:a4b95168b1427bc9785ed4ffdd2e97a31bc0e828209b1d0c786c23bb9b9f1225","observation_id":"b49f78fa-0bd8-428e-9379-b744193cd15c","resolution":{"observed_at":"2026-08-12T20:13:57.229795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.235031Z","title":"Neural audio synthesis of musical notes with wavenet autoencoders","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.235031Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:d3baf337e22a8e2c18d66aa6935f5be1b87592d8021d1ba6ed2c253d60abd7a6","observation_id":"4670fd8a-6965-4992-afbc-6b8c907bc4e8","resolution":{"observed_at":"2026-08-12T20:13:57.235031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-16T13:19:40.907971Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-12T20:13:57.240429Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.240429Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:5055c1e546bcf97d193d2fa1f033759067027a55ecfc8a14a4021b3eec2ac054","observation_id":"c7753991-651d-4217-b129-458db8c2962a","resolution":{"observed_at":"2026-08-12T20:13:57.240429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05719","last_updated":"2022-12-21T08:12:46Z","snapshot_observed_at":"2026-08-16T16:17:08.110897Z","submitted_at":"2022-11-10T17:37:04Z","title":"MMDialog: A Large-scale Multi-turn Dialogue Dataset Towards Multi-modal Open-domain Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05719","snapshot_observed_at":"2026-08-12T20:13:57.246032Z","title":"Mmdialog: A large-scale multi-turn dialogue dataset towards multi-modal open-domain conversation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.246032Z"},"links":{"cited_paper":"/paper/2211.05719","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:1d854b9a4a244b4e8871e92af8761ef9314ef6725bb6c0075e8e961a9adc4f4f","observation_id":"b7443e8b-4bfa-4c66-a79e-5940a9a44655","resolution":{"observed_at":"2026-08-12T20:13:57.246032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.252598Z","title":"Meisd: A mul- timodal multi-label emotion, intensity and sentiment dialogue dataset for emotion recognition and sentiment analysis in conversations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.252598Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6126b9236454981b1eb94fc3d109cfdc8395064cacd60f88863a0ec678c4fe4c","observation_id":"c892ff8d-7257-4dde-9b61-a0165ba24c30","resolution":{"observed_at":"2026-08-12T20:13:57.252598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.258464Z","title":"Fsd50k: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.258464Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:c373eee4568e379db5e31f0ad325f5359a6ee72cf33ecd99d1fc8f049325404f","observation_id":"7fbd5429-1d82-4448-8d25-882be6851d98","resolution":{"observed_at":"2026-08-12T20:13:57.258464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-16T13:27:24.086813Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-12T20:13:57.264011Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.264011Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:c20a77181c1cbd6ebac3aeef4d25d7012114b61d264b55db147ec0c65c1e44b7","observation_id":"a3d0aa0f-6dfe-4ed6-b2a5-2b9f75f34491","resolution":{"observed_at":"2026-08-12T20:13:57.264011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.269964Z","title":"A new algorithm for data compression","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.269964Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:469751e9927ce09c6ba01dffab2875c4fc13ff974905e31ad2f0b2284034a77c","observation_id":"320fcf89-fc93-43c6-9d0a-23b137322614","resolution":{"observed_at":"2026-08-12T20:13:57.269964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-08-18T20:55:45.273184Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-12T20:13:57.274992Z","title":"The people’s speech: A large-scale diverse english speech recognition dataset for commercial usage","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.274992Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:1da2a79af0b7238c86c64aae4f1d0a9cd15bbcc1724f9e061c6b60d3a2738ea1","observation_id":"424a669b-2016-4d62-a083-84d59e362c72","resolution":{"observed_at":"2026-08-12T20:13:57.274992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15483","last_updated":"2023-05-29T10:50:29Z","snapshot_observed_at":"2026-08-16T16:27:50.297567Z","submitted_at":"2022-09-30T14:15:03Z","title":"Augmentation Invariant Discrete Representation for Generative Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15483","snapshot_observed_at":"2026-08-12T20:13:57.280711Z","title":"Augmentation invariant discrete representation for generative spoken language modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.280711Z"},"links":{"cited_paper":"/paper/2209.15483","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:f3a504802626956d2fc31371c0b61b35b0a26c65d2fd50eda91c9add7a351677","observation_id":"b2eef2e6-8a45-4db4-ac5d-13225d60b5d2","resolution":{"observed_at":"2026-08-12T20:13:57.280711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.285812Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.285812Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:412041132f3453c668449e233d1162e0c2a6ed756517dd4c55cce4b145bbbd21","observation_id":"ef5af30d-ea6d-4a93-8541-893a3a1f877d","resolution":{"observed_at":"2026-08-12T20:13:57.285812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07616","last_updated":"2024-04-11T10:08:34Z","snapshot_observed_at":"2026-08-17T03:39:19.622005Z","submitted_at":"2024-04-11T10:08:34Z","title":"Audio Dialogues: Dialogues dataset for audio and music understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07616","snapshot_observed_at":"2026-08-12T20:13:57.290608Z","title":"Audio dialogues: Dialogues dataset for audio and music understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.290608Z"},"links":{"cited_paper":"/paper/2404.07616","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:86e5a9c5cf74c0ff9e753adf6b85b1d5a0df424dab0306b024eb4e14c497d30b","observation_id":"cb5e90a7-14b3-4374-b708-ab3f1a2d3636","resolution":{"observed_at":"2026-08-12T20:13:57.290608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.295612Z","title":"Joint audio and speech understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.295612Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:cdb8e4a6457f3d316c99b8d3d8e824bdb5849d5cf619241d7a4c5039bf54f1d6","observation_id":"f44c55d5-6058-46b7-be64-741411121f5b","resolution":{"observed_at":"2026-08-12T20:13:57.295612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-19T08:35:33.284411Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-12T20:13:57.300573Z","title":"Listen, think, and understand","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.300573Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3045f6b782ed392a7f9b33f704b3b385226b41a1d0fd7695b46e667f9b2cd94c","observation_id":"06bc3aeb-6d83-4f5a-bdd0-4ea1250cd62b","resolution":{"observed_at":"2026-08-12T20:13:57.300573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.305300Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.305300Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:c3d6d1867478a1ccfc1147371753cafc011a2f600cb8116bc12fe23582de7a23","observation_id":"3e5d15ca-1908-4d76-80bd-966b6e98ba46","resolution":{"observed_at":"2026-08-12T20:13:57.305300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00933","last_updated":"2024-09-02T04:13:20Z","snapshot_observed_at":"2026-08-16T13:22:13.109436Z","submitted_at":"2024-09-02T04:13:20Z","title":"SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00933","snapshot_observed_at":"2026-08-12T20:13:57.309591Z","title":"Socodec: A semantic-ordered multi-stream speech codec for efficient language model based text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.309591Z"},"links":{"cited_paper":"/paper/2409.00933","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:286cce569afabf4b2b9e3bdec6ac7b483ec32137621a390f40e0308284a3f5b5","observation_id":"65cf570b-5c58-4d67-86c8-06a44039bacd","resolution":{"observed_at":"2026-08-12T20:13:57.309591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.314935Z","title":"Prompttts: Controllable text-to-speech with text descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.314935Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:b50453225b2b40188b99020741085ed0943a5c22132872ca32d79e94914692d2","observation_id":"d9d32c8f-cb84-44a1-9072-da299d4e3e45","resolution":{"observed_at":"2026-08-12T20:13:57.314935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.320867Z","title":"Prediction of turn-taking using multitask learning with prediction of backchannels and fillers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.320867Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:33fa066e1661558700deb3f35aef212fd761ebdbaecf5a9698ebed4685cbacbe","observation_id":"2b7b6ff2-74d1-46e2-a9fa-00471ee69a4f","resolution":{"observed_at":"2026-08-12T20:13:57.320867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.327107Z","title":"Turn-taking prediction based on detection of transition relevance place","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.327107Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:2f7745787b1eeeefbaedaf8db95778e0891727752bebeb6eed330045fba4dc5d","observation_id":"9737d212-b214-4e07-ad82-87b2e567048c","resolution":{"observed_at":"2026-08-12T20:13:57.327107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.332330Z","title":"Textually pretrained speech language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.332330Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:11a12bcdee3cb9b72d148703fdf0fbca247ed58177c59cb92444f7891674b590","observation_id":"c2d1c409-67bf-4a72-a12b-104db40e5015","resolution":{"observed_at":"2026-08-12T20:13:57.332330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-19T12:19:32.667319Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-12T20:13:57.338204Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.338204Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8d06fce0f137f94a08fa4ebbd6ded8f7b38e3f5a8f6b3d561404f5507948e71c","observation_id":"3d7304d9-8e79-476a-8f6e-2b93f738b65a","resolution":{"observed_at":"2026-08-12T20:13:57.338204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T20:13:57.343744Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.343744Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:27bc5a0c9c8b3d5371f6c993f0a4d598e40fc58e7e780e54bca01878a55d1048","observation_id":"f45b7f13-d2c4-477a-bccc-97b8b805163f","resolution":{"observed_at":"2026-08-12T20:13:57.343744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.349347Z","title":"Cnn architectures for large-scale audio classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.349347Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:ec21998378ed6e3e77a094a100b780f548a4e5ca92ebd493124a314af01ecd85","observation_id":"d8c9351f-eaa2-49e5-8f47-6030e0f2cbca","resolution":{"observed_at":"2026-08-12T20:13:57.349347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08718","last_updated":"2022-03-23T19:47:21Z","snapshot_observed_at":"2026-07-06T11:01:02.207193Z","submitted_at":"2021-04-18T05:00:29Z","title":"CLIPScore: A Reference-free Evaluation Metric for Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08718","snapshot_observed_at":"2026-08-12T20:13:57.355821Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.355821Z"},"links":{"cited_paper":"/paper/2104.08718","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e03732106add13459410628f51ed66c569f423a9adb1d70e8033460960305689","observation_id":"dcebdad7-c22c-42f3-b06d-3063928ef62e","resolution":{"observed_at":"2026-08-12T20:13:57.355821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.363150Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.363150Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8999ee0eaf6053e20822010c2fa19cb462d0df91542e902d393470921bcd8576","observation_id":"4983beac-99aa-4b8f-be82-d5ce90e852b9","resolution":{"observed_at":"2026-08-12T20:13:57.363150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T20:13:57.369774Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.369774Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6e9fbd0f0466d378f62a46ef230cc8bc2c10453922cff1d0b87a3f505f1e346a","observation_id":"c156cbbf-a0d3-4c34-8ea9-10c02d575d6b","resolution":{"observed_at":"2026-08-12T20:13:57.369774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-19T04:10:32.002424Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-12T20:13:57.375568Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.375568Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3413b5edeed34d62e0e3f674cbc9f9b623adf38d1fbc8393a41432acc95324bb","observation_id":"800bb696-9382-4988-94b7-9b2b9178d651","resolution":{"observed_at":"2026-08-12T20:13:57.375568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-16T15:28:43.775568Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-12T20:13:57.381615Z","title":"Make-an-audio 2: Temporal-enhanced text-to-audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.381615Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:999aba5e40b9055724cf5783415ff995c4f845bea733269b50ded5645fe40881","observation_id":"e68359b0-08d7-421c-ac43-232da744a15f","resolution":{"observed_at":"2026-08-12T20:13:57.381615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-12T20:13:57.389289Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.389289Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:3a73d5d970e82f7f5d89f78e49ad55203368e180f4fd92a77d4336ffdba39a38","observation_id":"78790e59-b9bc-4cfd-9456-50750a7d4d98","resolution":{"observed_at":"2026-08-12T20:13:57.389289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.394628Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.394628Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:8dae680bf9681bf3f82891d673f1e2f05c1b9d5eaaf16a442d8d130db93be386","observation_id":"74190d8c-0307-4a0a-bc1f-7a279eae948e","resolution":{"observed_at":"2026-08-12T20:13:57.394628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.404916Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.404916Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:5ae23bb83e3986bf1bb83a383c3a44a7c7303dd80dd7428e505ef2748028d6af","observation_id":"9636719a-5540-4c0f-b20a-eea6761db9b7","resolution":{"observed_at":"2026-08-12T20:13:57.404916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10207","last_updated":"2022-03-06T14:25:34Z","snapshot_observed_at":"2026-08-16T17:26:09.208100Z","submitted_at":"2022-01-25T09:53:36Z","title":"SPIRAL: Self-supervised Perturbation-Invariant Representation Learning for Speech Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10207","snapshot_observed_at":"2026-08-12T20:13:57.409432Z","title":"Spiral: Self- supervised perturbation-invariant representation learning for speech pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.409432Z"},"links":{"cited_paper":"/paper/2201.10207","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:70eb497b70193c587b8513becbeaa75b5a2f65c3dd47dd5eefbd1f7ff5dc6a09","observation_id":"8fac6b86-0a5d-4cc2-a969-cf23b331ccaa","resolution":{"observed_at":"2026-08-12T20:13:57.409432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-17T17:21:34.645323Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-12T20:13:57.415495Z","title":"Repcodec: A speech representation codec for speech tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.415495Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:47ec03a6715e55ef79471a6484301da78ed3801db8b686ebb65b7d6ef0435751","observation_id":"b5802cc6-2358-49c6-9ae1-f78fe999229d","resolution":{"observed_at":"2026-08-12T20:13:57.415495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14732","last_updated":"2024-05-21T13:27:49Z","snapshot_observed_at":"2026-08-16T14:24:18.802441Z","submitted_at":"2024-01-26T09:42:51Z","title":"Residual Quantization with Implicit Neural Codebooks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14732","snapshot_observed_at":"2026-08-12T20:13:57.421599Z","title":"Residual quantization with implicit neural codebooks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.421599Z"},"links":{"cited_paper":"/paper/2401.14732","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:09aa3d235a861b80409b4b4d625eacaac19d939a24d8b383b2a6c75ba7315085","observation_id":"4a72e59f-fcf6-4b85-be7d-a80f72e08bc0","resolution":{"observed_at":"2026-08-12T20:13:57.421599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.427668Z","title":"The lj speech dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.427668Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:03f820de5e2b0ab6276f21cfa740b9ef9b5d501bb4a3ddd1ee7c3584488dac7c","observation_id":"297bc52d-5e5f-46a9-9a58-0ef872718c9a","resolution":{"observed_at":"2026-08-12T20:13:57.427668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12208","last_updated":"2025-06-04T05:50:15Z","snapshot_observed_at":"2026-08-18T17:50:56.393070Z","submitted_at":"2024-02-19T15:12:12Z","title":"Language-Codec: Bridging Discrete Codec Representations and Speech Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12208","snapshot_observed_at":"2026-08-12T20:13:57.433148Z","title":"Language-codec: Reducing the gaps between discrete codec representation and speech language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.433148Z"},"links":{"cited_paper":"/paper/2402.12208","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:7f07b62424ed6267545db36ee5b70f1dbd10ce8afd3867b2d331094814f51675","observation_id":"22c33a22-114c-4876-b8a3-46a984a0ee61","resolution":{"observed_at":"2026-08-12T20:13:57.433148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09378","last_updated":"2024-06-02T16:11:18Z","snapshot_observed_at":"2026-08-16T14:18:32.873382Z","submitted_at":"2024-02-14T18:24:41Z","title":"MobileSpeech: A Fast and High-Fidelity Framework for Mobile Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09378","snapshot_observed_at":"2026-08-12T20:13:57.439022Z","title":"Mobilespeech: A fast and high-fidelity framework for mobile zero-shot text-to-speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.439022Z"},"links":{"cited_paper":"/paper/2402.09378","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:bf6d263833393cc15e2d80b7a99ad0923168ed81eedd2e8c038b519110c74edf","observation_id":"606ba9b5-f3b4-4a90-bb14-e3bb82890f64","resolution":{"observed_at":"2026-08-12T20:13:57.439022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-12T20:13:57.445227Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.445227Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:9cd7507185cefc5fd1d5f83f5121e369c1fbe20b1799e7a82a018becf615255f","observation_id":"bd7dced9-e31f-430f-9d86-819999d292a9","resolution":{"observed_at":"2026-08-12T20:13:57.445227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.452414Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.452414Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:f3a07d43b61e52f6949a05acf6979fa86d766d02b3b0621599b6d7517d597b54","observation_id":"162d83f8-3c4e-496a-9284-758657d4296e","resolution":{"observed_at":"2026-08-12T20:13:57.452414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01205","last_updated":"2025-06-04T06:07:17Z","snapshot_observed_at":"2026-08-16T13:46:47.768553Z","submitted_at":"2024-06-03T11:15:16Z","title":"ControlSpeech: Towards Simultaneous and Independent Zero-shot Speaker Cloning and Zero-shot Language Style Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01205","snapshot_observed_at":"2026-08-12T20:13:57.458611Z","title":"Controlspeech: Towards simultaneous zero-shot speaker cloning and zero-shot language style control with decoupled codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.458611Z"},"links":{"cited_paper":"/paper/2406.01205","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:cdd30f368a79b7e1d02499110d54b6b837d4914f100178190833376f01fb361f","observation_id":"cf7bd55b-9218-4dcc-9454-8da0c777e3c1","resolution":{"observed_at":"2026-08-12T20:13:57.458611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03713","last_updated":"2022-06-26T06:14:05Z","snapshot_observed_at":"2026-08-16T17:29:09.887140Z","submitted_at":"2022-01-11T00:27:08Z","title":"CVSS Corpus and Massively Multilingual Speech-to-Speech Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03713","snapshot_observed_at":"2026-08-12T20:13:57.464641Z","title":"Cvss corpus and massively multilingual speech-to-speech translation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.464641Z"},"links":{"cited_paper":"/paper/2201.03713","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:6a2455e3e628f1d816a178144ec4c77bbd573e58100907646221fbbb8b520a09","observation_id":"4339d445-0079-4168-abe7-9884393aefd6","resolution":{"observed_at":"2026-08-12T20:13:57.464641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-12T20:13:57.471085Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.471085Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:360eb49aa791a01b7115371e3f537fbb925598845de062d57aa3c6e9c7a34931","observation_id":"6cbdc066-4c28-4f04-949c-950e41ec9983","resolution":{"observed_at":"2026-08-12T20:13:57.471085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.477265Z","title":"Mega-tts 2: Boosting prompting mechanisms for zero-shot speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.477265Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:2774552bc0367f97049a94d0b22ce78a2a981c5a45ba2c68b8c449f9f250cb33","observation_id":"d82b99ff-d4cf-4386-8c52-5efd5a7850d2","resolution":{"observed_at":"2026-08-12T20:13:57.477265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-08-16T15:26:15.205275Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-12T20:13:57.482560Z","title":"Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.482560Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:a34ac7f7426804d181fe8463054f2462a1016fe5fa217dd92a0419396b7c2ae4","observation_id":"f123214f-8997-456f-9770-df9e795a12df","resolution":{"observed_at":"2026-08-12T20:13:57.482560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.488402Z","title":"Duplex conversation in outbound agent system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.488402Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:e849bea9bf862fa41091418d2d3705a2088b9d0be5ec12912aeace25469fee60","observation_id":"b63a201b-1a26-444b-89ed-9f5f2bd1ded3","resolution":{"observed_at":"2026-08-12T20:13:57.488402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:13:57.494016Z","title":"Efficient multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T20:13:57.494016Z"},"links":{"citing_paper":"/paper/2411.13577"},"observation_digest":"sha256:46ff6e5f8676d353074626ff93abb9ec9f40aae03df3ffca887aa91d1bcd6735","observation_id":"fad135ec-e442-419b-929a-63b5ea94ab09","resolution":{"observed_at":"2026-08-12T20:13:57.494016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-15T08:49:03.887183Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":258},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 258 outbound references and 47 inbound Pith citation observations for arXiv:2411.13577."}