{"as_of":"2026-08-14T19:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c78cfa89d1ac70c017de6be827626a9debd5997f8cb31dcd1885c561d44254c3","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:33:04.440605Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:32:48.979492Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-07-14T19:56:33.793167Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.01895","last_updated":"2026-04-02T10:59:55Z","snapshot_observed_at":"2026-08-06T15:48:40.631159Z","submitted_at":"2026-04-02T10:59:55Z","title":"Sharp spectral estimates for free boundary problems arising in plasma physics","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T19:56:33.793167Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2604.01895"},"observation_digest":"sha256:b42ed6073d6369de57245a03a23f7a80e8d83ff24765a1638aff9b523bd3a56c","observation_id":"dea03cb1-03a1-4053-94de-a1dc01e7bdb3","resolution":{"observed_at":"2026-07-14T19:56:33.793167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2604.01897","last_updated":"2026-07-13T11:03:37Z","snapshot_observed_at":"2026-08-02T18:54:29.968214Z","submitted_at":"2026-04-02T11:00:37Z","title":"FastTurn: Unifying Acoustic and Streaming Semantic Cues for Low-Latency and Robust Turn Detection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T20:55:09.141906Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2604.01897"},"observation_digest":"sha256:3749009dbafe992b54ebdce3de841cd1e9756ce701e2a7583aae45c666f19fc9","observation_id":"67a9010d-fc45-4501-bd0a-6f4fc67fa2b1","resolution":{"observed_at":"2026-05-13T20:58:15.972122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2604.13804","last_updated":"2026-04-15T12:39:03Z","snapshot_observed_at":"2026-07-06T23:01:41.643335Z","submitted_at":"2026-04-15T12:39:03Z","title":"Character Beyond Speech: Leveraging Role-Playing Evaluation in Audio Large Language Models via Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:22:25.660785Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2604.13804"},"observation_digest":"sha256:1d76e9c27cce9e713c23f8989caf6aca6aaf1dbce0d5138f524d4badb21a8892","observation_id":"b1256418-e584-4cf8-8127-c9bc5817f103","resolution":{"observed_at":"2026-05-10T14:25:30.009190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2604.19221","last_updated":"2026-04-30T07:45:08Z","snapshot_observed_at":"2026-08-11T09:39:20.137545Z","submitted_at":"2026-04-21T08:24:55Z","title":"UAF: A Unified Audio Front-end LLM for Full-Duplex Speech Interaction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T03:05:48.624864Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2604.19221"},"observation_digest":"sha256:ee98ab1426a2757462a4f0a709df83982a166d4326ee1efa5fd885ef9897bd66","observation_id":"41927dc5-e490-4186-8ad9-6c1987d87d6b","resolution":{"observed_at":"2026-05-11T12:46:02.917082Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2604.21406","last_updated":"2026-04-24T04:15:19Z","snapshot_observed_at":"2026-08-11T05:34:02.588404Z","submitted_at":"2026-04-23T08:21:52Z","title":"Full-Duplex Interaction in Spoken Dialogue Systems: A Comprehensive Study from the ICASSP 2026 HumDial Challenge","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T13:19:44.156822Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2604.21406"},"observation_digest":"sha256:465de33e114e29715f6ca4419a8ff5bf6a8f98847276df503c17bf7206c93aee","observation_id":"3dad1224-4a7d-4592-80f7-d8f425e56c68","resolution":{"observed_at":"2026-05-11T18:56:06.768627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-13T08:34:51.322925Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:8fe08fd3c7158261fce1668c17b0d3e8674b89e1f9312589ed1f8e7fbeb6b3e9","observation_id":"b3d65389-0e50-48cc-822c-2a2bca7a1c3a","resolution":{"observed_at":"2026-05-21T07:39:48.856075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":242,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:370c621c851c678ff80af92d2e69271e8fc04a261d84b04bf1382bb6bfc1e4e3","observation_id":"85a105ac-f36a-4085-a9e7-8e87c3c085d6","resolution":{"observed_at":"2026-06-29T23:04:01.970453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-08-13T15:48:57.500872Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:ad4e0a799cebb916785922f672d8e75e769daea5286bbd6f861b1055da99765f","observation_id":"c0790e81-cf1e-4270-acb2-ee9fcfb8f26a","resolution":{"observed_at":"2026-06-28T17:52:27.008372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-12T18:53:54.395143Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T23:42:38.203116Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.06559"},"observation_digest":"sha256:f986468d65520fc47ad9dfa997bfacc7f1c0e2fc36c285f3be7dbefee1c25be8","observation_id":"c38ca1ef-7655-4a2b-9b92-a58c75889d50","resolution":{"observed_at":"2026-07-02T15:37:06.832714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.09186","last_updated":"2026-06-08T08:23:02Z","snapshot_observed_at":"2026-08-12T23:18:48.473844Z","submitted_at":"2026-06-08T08:23:02Z","title":"DuplexOmni: Real-Time Listening, Seeing, Thinking, and Speaking for Full-Duplex Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:02.107863Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.09186"},"observation_digest":"sha256:80d04eabbd4cb749f50f75e9c5d86bed2f1f39993db0d18389feda658f8fbea3","observation_id":"7de6918a-8e30-45ad-bd8b-ba362a98e847","resolution":{"observed_at":"2026-07-03T03:27:34.977710Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.18094","last_updated":"2026-06-16T15:58:36Z","snapshot_observed_at":"2026-08-14T07:44:16.589091Z","submitted_at":"2026-06-16T15:58:36Z","title":"Next-Turn: Duration-Aware Streaming Endpoint Detection via Time-to-Next-Speech-Onset Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T22:43:07.952982Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.18094"},"observation_digest":"sha256:a4e9bbe4394741157b6e09705bd77d1402841fa707f4fa98afb10c718dda57c9","observation_id":"c1d3cbd1-005d-477c-970c-ca1d6e1ba0b9","resolution":{"observed_at":"2026-07-03T23:19:03.200742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-08-12T18:49:26.971639Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:64568558dfec1a6da737a4e112ec38587f6503cfd3d4a1b3672171a4c7c2c5e2","observation_id":"4b3cdabd-2207-42fd-842b-80b5c1a22b6f","resolution":{"observed_at":"2026-07-04T02:49:25.022076Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":"2509.06502","doi":"10.48550/arxiv.2509.06502","metadata_source":"pith","pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireredchat: A pluggable, full-duplex voice in- teraction system with cascaded and semi-cascaded implementa- tions","venue":"cs.SD","work_id":"373dad83-3519-4449-a200-f05a328b52d1","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-07T11:01:55.500168Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:0b9650981a38e2277758b26914f92c31c0512bb7dc896ad902e22b2c735ebf91","observation_id":"a16fb13d-a686-47bf-abd6-aa0345df9fa1","resolution":{"observed_at":"2026-07-08T02:44:27.639858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:48.272754+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-01T07:12:17.660388Z","title":"arXiv preprint arXiv:2509.06502 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-13T09:55:09.197044Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":136,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:17.660388Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:2c4afd5f3f69f66b5a2a95a4888dfd84fa1f813506154e809a42260bdd3ebcc1","observation_id":"29159b17-543c-4164-8f7b-3c4da820bcc9","resolution":{"observed_at":"2026-08-01T07:12:17.660388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06502","snapshot_observed_at":"2026-08-11T00:32:48.979492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.07631","last_updated":"2026-08-07T12:55:43Z","snapshot_observed_at":"2026-08-14T06:51:28.204429Z","submitted_at":"2026-08-07T12:55:43Z","title":"PACE: A Playback-Aligned Context Engine for LLM-Based Full-Duplex Voice Dialogue","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T00:32:48.979492Z"},"links":{"cited_paper":"/paper/2509.06502","citing_paper":"/paper/2608.07631"},"observation_digest":"sha256:dca5674cf9becade333aef14620e77f44e3c9aacd1839aaa04997c922312b055","observation_id":"dcb128bd-a717-4591-b006-20287693d2d9","resolution":{"observed_at":"2026-08-11T00:32:48.979492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.06502/citation-record","integrity":"/paper/2509.06502/integrity","json":"/paper/2509.06502/citation-record.json","paper":"/paper/2509.06502"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:04.250057Z","title":"Language model can listen while speaking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.250057Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:aeb3d3ccc4698c991c7b21d601f222e29c0e794ab1187575960b823d10cab60c","observation_id":"71433634-9a26-437f-9e75-926ab2296dc2","resolution":{"observed_at":"2026-08-04T23:33:04.250057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14350","last_updated":"2025-01-24T09:21:41Z","snapshot_observed_at":"2026-08-10T15:12:09.149596Z","submitted_at":"2025-01-24T09:21:41Z","title":"FireRedASR: Open-Source Industrial-Grade Mandarin Speech Recognition Models from Encoder-Decoder to LLM Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14350","snapshot_observed_at":"2026-08-04T23:33:04.254815Z","title":"Fireredasr: Open-source industrial-grade mandarin speech recognition models from encoder-decoder to llm integration.arXiv preprint arXiv:2501.14350, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.254815Z"},"links":{"cited_paper":"/paper/2501.14350","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:4e4b32e809a9fc64e8316503e600469664b07f1a1bbcec391910f65988dc8075","observation_id":"d967b855-1997-4bd7-af2c-283bdc1ed2aa","resolution":{"observed_at":"2026-08-04T23:33:04.254815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:04.259615Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.259615Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:5660000eab8ce474ae52c0ef60290cdba0f414d88183836ee0beb46b5842f20a","observation_id":"856ba448-6ad8-40c7-bde6-79c8d6bdb809","resolution":{"observed_at":"2026-08-04T23:33:04.259615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T23:33:04.264673Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.264673Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:548ab846b4ada1f35287df2eb2fa7dfc8819d0316857523c36ed22601cd4680a","observation_id":"31617b23-ce73-4fa1-85ec-f0d1fbfcdf64","resolution":{"observed_at":"2026-08-04T23:33:04.264673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10403","last_updated":"2023-09-13T20:35:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:46:53Z","title":"PaLM 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10403","snapshot_observed_at":"2026-08-04T23:33:04.269751Z","title":"Palm 2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.269751Z"},"links":{"cited_paper":"/paper/2305.10403","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:650fea95cd48ef7ec3d8be79594ba86bf7997a9ca3bf742e5184df346d52c443","observation_id":"36e08717-022c-4c7d-8470-a4858e4c9170","resolution":{"observed_at":"2026-08-04T23:33:04.269751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.120826Z","title":"Palm: Scaling language modeling with pathways.Journal of Machine Learning Research, 24(240):1– 113, 2023","venue":null,"work_id":"c59c7b6a-8b11-4544-85a7-57d686323047","year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.274465Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:60063e7d570d5d36f8530db7cd38575a2588bbdbcd6bef51cf9735d12337af45","observation_id":"24b82739-7c96-4de2-8139-9933c238c640","resolution":{"observed_at":"2026-08-04T23:33:05.125579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-04T23:33:04.280184Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.280184Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:c98614b391741a7421092f7f2321d02dd59b45b294c8abf04d1cbfb3af9bab3b","observation_id":"748d9b25-c1de-46f3-9b9a-9470e68a7e22","resolution":{"observed_at":"2026-08-04T23:33:04.280184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T23:33:04.284817Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.284817Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:5aac5a8a696d0fbbe294f03f44b6a26d4e7b525bb5f7cd94098b60ae1a8a0f1e","observation_id":"b06dab49-18f0-42dd-926d-a81c4090a579","resolution":{"observed_at":"2026-08-04T23:33:04.284817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-14T01:59:59.515548Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-04T23:33:04.290230Z","title":"Fireredtts: A foundation text-to-speech framework for industry-level generative speech applications.arXiv preprint arXiv:2409.03283, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.290230Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:58511070eeb4ad03fe3578cfc29599b3cc59e538365d1a19ca7483acc105027c","observation_id":"dfafd71d-d7a0-4111-ac51-e2955428a5c4","resolution":{"observed_at":"2026-08-04T23:33:04.290230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20499","last_updated":"2025-05-26T11:34:20Z","snapshot_observed_at":"2026-08-14T18:01:41.768577Z","submitted_at":"2025-03-26T12:39:06Z","title":"FireRedTTS-1S: An Upgraded Streamable Foundation Text-to-Speech System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20499","snapshot_observed_at":"2026-08-04T23:33:04.295185Z","title":"Fireredtts-1s: An upgraded streamable foundation text-to-speech system.arXiv preprint arXiv:2503.20499, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.295185Z"},"links":{"cited_paper":"/paper/2503.20499","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:5771ecd0a8b2293823513bb60576b650922ced2f1b777d530268f4825a7e0d34","observation_id":"fb92917a-2c22-4077-bdc3-fbce6b7367a6","resolution":{"observed_at":"2026-08-04T23:33:04.295185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-04T23:33:04.300272Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.300272Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:8b5787a0bcb29c9e6e8ef35eef3f565552f139e6385b4a076b23ca5c7b56f13e","observation_id":"77deba1c-ad6d-4bf9-bd45-596e418d04be","resolution":{"observed_at":"2026-08-04T23:33:04.300272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-13T01:08:56.872280Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-04T23:33:04.305017Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.305017Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:c390420f68846f995acb5a916aee247ce7cd0b27aa13c2979f596def5e73898e","observation_id":"af312011-2a92-4834-9921-60ccf5a856f8","resolution":{"observed_at":"2026-08-04T23:33:04.305017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-04T23:33:04.309604Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.309604Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:2fec5beccbf268e524d4468a924a337b0746c138ec442d45b07bfc732300edec","observation_id":"1487957e-79ab-4554-a936-39b2e32322a5","resolution":{"observed_at":"2026-08-04T23:33:04.309604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02020","last_updated":"2025-09-04T03:36:39Z","snapshot_observed_at":"2026-08-10T18:31:06.041111Z","submitted_at":"2025-09-02T07:06:46Z","title":"FireRedTTS-2: Towards Long Conversational Speech Generation for Podcast and Chatbot","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02020","snapshot_observed_at":"2026-08-04T23:33:04.314045Z","title":"Fireredtts-2: Towards long conversational speech generation for podcast and chatbot.arXiv preprint arXiv:2509.02020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.314045Z"},"links":{"cited_paper":"/paper/2509.02020","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:170aaa58a02d79683334ed313ff7253a94c70f0a86ae76f373dbf1ba92643741","observation_id":"4bcdddd7-3fe6-47af-9e1d-29abea65a4a3","resolution":{"observed_at":"2026-08-04T23:33:04.314045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T23:33:04.318899Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models.arXiv preprint arXiv:2311.07919, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.318899Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:6866ec3e4cd9091a6f877a99f457afe3ccd21d15d2c530beb54727757448c991","observation_id":"ed82bd03-99df-4374-ac13-3261b28b0f55","resolution":{"observed_at":"2026-08-04T23:33:04.318899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-04T23:33:04.323245Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.323245Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:6e1be6249ca74f299ae3b0b5bd4f6fc11c365bf1eb22c139e608a178d8a42bf2","observation_id":"b4ea8345-9eaf-43e7-94e2-a40807445695","resolution":{"observed_at":"2026-08-04T23:33:04.323245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-04T23:33:04.328109Z","title":"Salmonn: Towards generic hearing abilities for large language models.arXiv preprint arXiv:2310.13289, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.328109Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:aaf60a76e558ababc9235d7c6da3d5a2038ffa0a543a2ace8852aad64e3c925a","observation_id":"fdecef75-c7dc-4108-b867-052072978002","resolution":{"observed_at":"2026-08-04T23:33:04.328109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.105947Z","title":"On decoder-only architecture for speech-to-text and large language model integration","venue":null,"work_id":"b33c3cb5-83d3-46a0-a3e9-85d9656bfdcc","year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.332451Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:1f23e6576c19c3d9de6770391acd04da448802ba2e66b27b5cfa5945e2db88d3","observation_id":"a1191367-3a92-4221-b0c1-3fa130b6395f","resolution":{"observed_at":"2026-08-04T23:33:05.110428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.090897Z","title":"Midashenglm: Efficient audio understanding with general audio captions","venue":null,"work_id":"efed3698-8ac3-42b0-aabd-bbed44a54ee2","year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.336816Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:b9dff5939faab06f97ed79756b154fd76c0d2a0c361dbe7129fd934da08ffa6a","observation_id":"4a79d3b4-ea3f-456d-b918-d4b23008a19a","resolution":{"observed_at":"2026-08-04T23:33:05.095780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-13T11:39:26.737742Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-04T23:33:04.341502Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities.arXiv preprint arXiv:2305.11000, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.341502Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:58afb6f51aca337e7a8231cbc05532ab138d4ecc97bdc1af2383c3d6cdef4af6","observation_id":"57fbd1f0-04d2-4e4f-8e7a-2cd30255b309","resolution":{"observed_at":"2026-08-04T23:33:04.341502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-13T05:55:03.054769Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-04T23:33:04.346067Z","title":"Lauragpt: Listen, attend, understand, and regenerate audio with gpt.arXiv preprint arXiv:2310.04673, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.346067Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:9746f9fec137ad48cd199c9bb77f8f46c79908253f4cf206f5af4c04a604bc72","observation_id":"4ac6042f-557b-4108-91ec-10fe944b8558","resolution":{"observed_at":"2026-08-04T23:33:04.346067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-12T22:55:00.524050Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-04T23:33:04.351245Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming.arXiv preprint arXiv:2408.16725, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.351245Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:339eac560656f6feaa0bc9cced9e27c0fbac8c4552ffd31fde7b167dd738c44c","observation_id":"1133596e-709f-40f9-abbc-a587384152ce","resolution":{"observed_at":"2026-08-04T23:33:04.351245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-08-12T22:47:34.452271Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T23:33:04.355944Z","title":"Llama-omni: Seamless speech interaction with large language models.arXiv preprint arXiv:2409.06666, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.355944Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:6a7e046b66ad6b8fc40bfc7717ae3af9df712d9abcdf50b9fe481f717d57a053","observation_id":"91a0b4c1-b79f-45db-8bae-2e63819c3e44","resolution":{"observed_at":"2026-08-04T23:33:04.355944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-04T23:33:04.360276Z","title":"Kimi-audio technical report.arXiv preprint arXiv:2504.18425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.360276Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:62d0adef93b105e63e37c65af913458faa3f02ce672840b63afa253c7edf1bb3","observation_id":"1e1e6c90-c6fa-4a2b-93b4-275876923c7b","resolution":{"observed_at":"2026-08-04T23:33:04.360276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-04T23:33:04.365289Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction.arXiv preprint arXiv:2502.11946, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.365289Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:71f6be3420e01b919e96043427f7b0343198b0381e1f290c36ad1a9501d57daa","observation_id":"8414ac38-d467-4926-aa9b-69b49218c480","resolution":{"observed_at":"2026-08-04T23:33:04.365289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-04T23:33:04.370374Z","title":"Step-audio 2 technical report.arXiv preprint arXiv:2507.16632, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.370374Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:63904d5ea58caaeace1d8f835a3e0c3927a1451499e0e8a6f01fc31500065cfd","observation_id":"48183592-f51d-4b42-9b57-2cbdb605a5a5","resolution":{"observed_at":"2026-08-04T23:33:04.370374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T23:33:04.374957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.374957Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:3ce151f75e77d7d4c68bd8744edca79f7bb1495ef0230e3bfdc8af04ff3d587c","observation_id":"b49a32dd-0dd7-43c0-b00b-16f259e7d65c","resolution":{"observed_at":"2026-08-04T23:33:04.374957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:04.380256Z","title":"Generative spoken dialogue language modeling.Transactions of the Association for Computational Linguistics, 11:250–266, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.380256Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:9667af4af73b2a2070da189ca568a252e746fbfe7be39f9a986010bf9a6bcd13","observation_id":"eaa8e3d7-39f5-4879-89d0-b7e6a31f9b24","resolution":{"observed_at":"2026-08-04T23:33:04.380256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-04T23:33:04.384384Z","title":"Moshi: a speech-text foundation model for real-time dialogue.arXiv preprint arXiv:2410.00037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.384384Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:e9a7116436ed41253d60f2554c5e79b4aeb102551f38a5320332b20b38117c63","observation_id":"9f486ef7-f8d1-4b35-b62a-74ddce21d88a","resolution":{"observed_at":"2026-08-04T23:33:04.384384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-12T22:09:32.316241Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-04T23:33:04.388843Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm.arXiv preprint arXiv:2411.00774, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.388843Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:0e26ca67d127a27efa64cb67b1720dff02eadc9e6c0c7e012ac0e8d8a7bbcd55","observation_id":"f0ab0b96-75d1-446c-944d-1a3dc177c3d3","resolution":{"observed_at":"2026-08-04T23:33:04.388843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-13T18:35:10.938726Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-04T23:33:04.393443Z","title":"Minmo: A multimodal large language model for seamless voice interaction.arXiv preprint arXiv:2501.06282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.393443Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:42400daccac54a1aca2f196235bf0e1fca03ac6e08a50b8da0d75e8d4f3cc8f5","observation_id":"f5052c7e-0f0d-4940-b654-d55c810e0ddf","resolution":{"observed_at":"2026-08-04T23:33:04.393443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10874","last_updated":"2020-10-21T09:58:39Z","snapshot_observed_at":"2026-07-06T10:06:34.778687Z","submitted_at":"2020-10-21T09:58:39Z","title":"TurnGPT: a Transformer-based Language Model for Predicting Turn-taking in Spoken Dialog","version":1},"cited_work":{"arxiv_id":"2010.10874","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.10874","snapshot_observed_at":"2026-08-04T23:33:04.566372Z","title":"TurnGPT: a Transformer-based Language Model for Predicting Turn-taking in Spoken Dialog","venue":"cs.CL","work_id":"2fee6c65-f07a-4eb6-aafe-2e306a14e9f8","year":2020},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.397911Z"},"links":{"cited_paper":"/paper/2010.10874","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:daa7c6fa08b50593cda5b6ca611715d0aeab899e0addf3243150ae631d3bf136","observation_id":"c5dfec1c-1bd4-4795-b120-688c9f712788","resolution":{"observed_at":"2026-08-04T23:33:04.573945Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-14T07:40:15.178514Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-04T23:33:04.402405Z","title":"Vita: Towards open-source interactive omni multimodal llm.arXiv preprint arXiv:2408.05211, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.402405Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:0c1948fd339c7c485dadefeca4a9faf3637871a645ddac7f18800a188e2e08e7","observation_id":"f204dd5b-a186-4075-90f4-d271379ccf90","resolution":{"observed_at":"2026-08-04T23:33:04.402405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13472","last_updated":"2025-05-29T03:32:21Z","snapshot_observed_at":"2026-08-08T15:44:10.934917Z","submitted_at":"2025-02-19T06:51:34Z","title":"FlexDuo: A Pluggable System for Enabling Full-Duplex Capabilities in Speech Dialogue Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13472","snapshot_observed_at":"2026-08-04T23:33:04.406922Z","title":"Flexduo: A pluggable system for enabling full-duplex capabilities in speech dialogue systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.406922Z"},"links":{"cited_paper":"/paper/2502.13472","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:f4a3720a4df8a7b9953837dfb0e0687fae97f4e83195f5a9a035ae0896765a8e","observation_id":"1bc46d95-ba2f-4698-8146-5a6e19e80214","resolution":{"observed_at":"2026-08-04T23:33:04.406922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.064947Z","title":"Two-dimensional convo- lutional recurrent neural networks for speech activity detection","venue":null,"work_id":"c3c054b2-bd3e-4344-accb-d2da22428846","year":2019},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.412667Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:279532e4741cc39d605e6fa7ffa4c35ae5c75993b4ea3fd6c1c8e54e28edd52c","observation_id":"e5152855-8cd5-44ae-bce2-8207dba0df24","resolution":{"observed_at":"2026-08-04T23:33:05.069463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-13T13:28:56.694752Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-04T23:33:04.418810Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification.arXiv preprint arXiv:2005.07143, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.418810Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:7ad6a68d73c2b08625a546d6eaea7b4f1304feb3ab8ebd4378c116640fd85798","observation_id":"35f4d060-4658-49cd-baea-75d918595825","resolution":{"observed_at":"2026-08-04T23:33:04.418810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.049164Z","title":"Gate-variants of gated recurrent unit (gru) neural networks","venue":null,"work_id":"b9db499b-d2b2-463d-94f0-3b1e0ad9b13b","year":2017},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.423865Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:695b5c203ff07ff4fe4df002b7015c1880f6f72777d7d0cd8562778eb36c0e86","observation_id":"da835b30-68aa-4e24-b0c1-633d282d0e69","resolution":{"observed_at":"2026-08-04T23:33:05.053675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.08484","last_updated":"2015-10-28T20:59:04Z","snapshot_observed_at":"2026-07-06T04:34:36.474437Z","submitted_at":"2015-10-28T20:59:04Z","title":"MUSAN: A Music, Speech, and Noise Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.08484","snapshot_observed_at":"2026-08-04T23:33:04.428772Z","title":"Musan: A music, speech, and noise corpus","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.428772Z"},"links":{"cited_paper":"/paper/1510.08484","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:3a13f23339daa5749c45c62303a1daf04605a4f40770d2830632d0fdae1ec727","observation_id":"6f55e5d7-fb80-455c-8824-8e3284e183ee","resolution":{"observed_at":"2026-08-04T23:33:04.428772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.032609Z","title":"Icassp 2023 deep noise suppression challenge.IEEE Open Journal of Signal Processing, 5:725–737, 2024","venue":null,"work_id":"0a710044-2e27-4c30-adba-d61797eb35f5","year":2023},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.435348Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:5b5cde791eaf034d3d2d344a7f48a94461dea9b7113066d9be0c77df043db84c","observation_id":"2410f311-0bb7-4efe-bb22-c8c43028b262","resolution":{"observed_at":"2026-08-04T23:33:05.038001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:05.015935Z","title":"Ten turn detection: Turn detection for full-duplex dialogue communication, 2025","venue":null,"work_id":"df75598c-383e-4fd1-aa85-ab7821b9cf50","year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.440605Z"},"links":{"citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:08ea31186b43bbafcecc61986c07803f03b2516449148569603f6189834339a4","observation_id":"0944fa8d-d40b-4925-9c23-a00429b51fea","resolution":{"observed_at":"2026-08-04T23:33:05.021171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T21:09:54.215392Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 15 inbound Pith citation observations for arXiv:2509.06502."}