{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:754712de1b106a20d446a40d19739f644033d8c55b4c92cbde2fbe17b21c442f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:41.290160Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.618647Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:2f7cb1850ad9901b33a22e030acb5dfa2c3e77558d0f0978203ca9b12a1f5576","observation_id":"fb405710-ace2-4573-96ce-9fe6ab8a30e6","resolution":{"observed_at":"2026-05-22T20:45:08.090805Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:1ce5c15a35ca1a96a496794e116e83923659d51802721dc44682082e843de6cd","observation_id":"c83853fe-f3cb-483e-87e1-b1057fa3c21c","resolution":{"observed_at":"2026-05-11T19:21:27.163815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T15:15:41.290160Z","title":"Omniflatten: An end-to- end gpt model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15670","last_updated":"2025-07-25T15:07:10Z","snapshot_observed_at":"2026-08-09T02:59:04.485815Z","submitted_at":"2025-05-21T15:48:30Z","title":"SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.290160Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2505.15670"},"observation_digest":"sha256:d123a39708533a10fd4d533a5a98bafbf24c1ccc3ba34d08c5f5bf5ca9972d28","observation_id":"85dcecb1-992d-4578-8b26-c89e185417b4","resolution":{"observed_at":"2026-08-07T15:15:41.290160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T14:16:33.651088Z","title":"Omniflatten: An end-to-end GPT model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19577","last_updated":"2025-06-30T16:21:25Z","snapshot_observed_at":"2026-08-09T07:23:25.547072Z","submitted_at":"2025-05-26T06:47:43Z","title":"MFA-KWS: Effective Keyword Spotting with Multi-head Frame-asynchronous Decoding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:33.651088Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2505.19577"},"observation_digest":"sha256:7b60c4b52a0756ce963227942860a67cbde0b2ce39d0c76ef59c7a1cda273b6a","observation_id":"36838518-ea4c-4399-8fe0-0f8f9a24e688","resolution":{"observed_at":"2026-08-07T14:16:33.651088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T14:01:33.643898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20277","last_updated":"2025-06-05T14:53:28Z","snapshot_observed_at":"2026-08-07T13:53:27.003686Z","submitted_at":"2025-05-26T17:55:06Z","title":"OmniCharacter: Towards Immersive Role-Playing Agents with Seamless Speech-Language Personality Interaction","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:33.643898Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2505.20277"},"observation_digest":"sha256:698175477027a9b82ff573821dd7d85458a53ab4c91f6a61e8b82ee69b59ab3b","observation_id":"c9ece6e9-ab2c-4fc1-a4bd-f1f51696b6cb","resolution":{"observed_at":"2026-08-07T14:01:33.643898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T12:04:32.164735Z","title":"Omniflatten: An end-to-end gpt model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00722","last_updated":"2025-05-31T21:43:37Z","snapshot_observed_at":"2026-08-09T13:25:00.234934Z","submitted_at":"2025-05-31T21:43:37Z","title":"Chain-of-Thought Training for Open E2E Spoken Dialogue Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:04:32.164735Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2506.00722"},"observation_digest":"sha256:5a92865dbdb84242a634ed6a0340f4620144ff91cabf35cd3bc4ce5ac586c505","observation_id":"eb7c36ed-3245-4565-994f-66586859dc67","resolution":{"observed_at":"2026-08-07T12:04:32.164735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T11:37:29.589186Z","title":"Omniflatten: An end-to-end gpt model for seamless voice conversation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01934","last_updated":"2025-06-02T17:53:10Z","snapshot_observed_at":"2026-08-09T09:09:21.347203Z","submitted_at":"2025-06-02T17:53:10Z","title":"RoboEgo System Card: An Omnimodal Model with Native Full Duplexity","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:29.589186Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2506.01934"},"observation_digest":"sha256:b339dd3b9c495bd5c612931b55b979793f1ac3ed023d8f51bb467d3fecb8baa8","observation_id":"be8c39de-ae70-4e0d-8c33-8fc5ed74d9d9","resolution":{"observed_at":"2026-08-07T11:37:29.589186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T11:26:23.261871Z","title":"OmniFlatten: An end-to-end GPT model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02457","last_updated":"2025-06-03T05:21:51Z","snapshot_observed_at":"2026-08-08T20:25:15.377786Z","submitted_at":"2025-06-03T05:21:51Z","title":"SOVA-Bench: Benchmarking the Speech Conversation Ability for LLM-based Voice Assistant","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:23.261871Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2506.02457"},"observation_digest":"sha256:9ae6969c1322e7dd81d3f55d3528398e8363797050152eaf02d67618deff9430","observation_id":"101c2dd5-5392-419c-820a-30b3c3d19b08","resolution":{"observed_at":"2026-08-07T11:26:23.261871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-08-07T11:14:22.105456Z","title":"Omniflatten: An end-to-end gpt model for seamless voice conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02979","last_updated":"2025-06-03T15:16:50Z","snapshot_observed_at":"2026-08-07T11:27:13.045145Z","submitted_at":"2025-06-03T15:16:50Z","title":"Towards a Japanese Full-duplex Spoken Dialogue System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:22.105456Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2506.02979"},"observation_digest":"sha256:58a26981b6af4f773411aecbb201b22285b1052723f6e0293489cd402deb5661","observation_id":"ed9ba575-ae16-4a2c-983b-45aea7512050","resolution":{"observed_at":"2026-08-07T11:14:22.105456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2604.23295","last_updated":"2026-05-25T03:30:22Z","snapshot_observed_at":"2026-07-06T23:09:34.300163Z","submitted_at":"2026-04-25T13:18:40Z","title":"Human-1 by Josh Talks: A Full-Duplex Conversational Modeling Framework in Hindi using Real-World Conversations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T08:16:47.522489Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2604.23295"},"observation_digest":"sha256:be314725d5dc6d1882937ed5203ca9f151ec432342f873a9c33a337fd584e6db","observation_id":"e2e8f988-7ca1-4a6e-b3dc-b77a7801117e","resolution":{"observed_at":"2026-05-11T20:41:13.537497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T02:41:13.583493Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:8a732c24f5d1f4ff5af91f7654c43eff121a85414f2d71c1c1a9256c1e732294","observation_id":"f893969a-10cc-4c71-a33c-0d15ec9b9280","resolution":{"observed_at":"2026-05-21T02:43:55.020751Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2605.20755","last_updated":"2026-06-11T05:13:51Z","snapshot_observed_at":"2026-08-02T13:39:32.672112Z","submitted_at":"2026-05-20T05:54:08Z","title":"DuplexSLA: A Full-Duplex Spoken Language Model with Synchronized Speech, Language, and Action","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:58.848455Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2605.20755"},"observation_digest":"sha256:3f213f6d89e0f1e2f792c0ca17daa5b296a277cb039e8d869ffbd439067ebb96","observation_id":"cf4b8bca-23fe-4d39-bbd1-7b9578862be6","resolution":{"observed_at":"2026-06-30T17:34:57.341812Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T05:32:27.371597Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:7ca128b8add8b856cffac08ff0e6fd3e88ed15f1e47109bd7b74f73d62162737","observation_id":"e48d3c14-ef46-4547-a860-9c8bc330e0e4","resolution":{"observed_at":"2026-07-03T16:28:39.528086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:01:44.202712Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:6b15ad64c860f8cb78cce1e6e884874f195c7b440f7848a6879ca839d21fbbfa","observation_id":"03f7f018-8dba-4bb2-90a1-4cb5ee56fc65","resolution":{"observed_at":"2026-06-29T18:43:51.437322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:65a14c99c2d675398b8e17dc5a1521c19ca1543943a3200e1312e2145500d6af","observation_id":"70c0d121-4990-40e0-841d-48140afe23ba","resolution":{"observed_at":"2026-07-04T16:49:57.620434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:732cebed5a5f92376fd62cfea7d67f0d46f5d8c78ada1310f8fd5e00f9e0f61e","observation_id":"c709267e-fe91-4e2f-94a1-f6a2e75eb310","resolution":{"observed_at":"2026-07-04T13:09:50.925205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation","version":2},"cited_work":{"arxiv_id":"2410.17799","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.17799","snapshot_observed_at":"2026-07-04T16:49:57.618647Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"84e4a3d5-c1b2-4c2c-b9fb-c57842475ea5","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2410.17799","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:2d322450bd3aa0c6823f6d230b04992a9505610f126b90bc1cdb8a6d73786954","observation_id":"6678f19d-4d87-4b61-84b9-ce66a6415e4b","resolution":{"observed_at":"2026-06-30T09:44:37.404501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.17799/citation-record","integrity":"/paper/2410.17799/integrity","json":"/paper/2410.17799/citation-record.json","paper":"/paper/2410.17799"},"outbound":[],"paper":{"arxiv_id":"2410.17799","last_updated":"2025-01-03T06:15:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T19:38:26.783620Z","submitted_at":"2024-10-23T11:58:58Z","title":"OmniFlatten: An End-to-end GPT Model for Seamless Voice Conversation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2410.17799."}