{"as_of":"2026-08-08T20:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5689e5882130526710b559b73d32716c4d3ec03e81fbdc4edeaed2fb2f854024","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":32,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:41.249905Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-18T13:39:48.225482Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2502.11946"},"observation_digest":"sha256:28f0732c0af0b9dd01e6f5aba84162dc34bc62f17e0ef3fa70387322533b04d2","observation_id":"b8366d02-27ad-4e39-8c1c-979a30e28278","resolution":{"observed_at":"2026-05-18T13:39:48.414015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:03.225439Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2503.20215"},"observation_digest":"sha256:4a5f7ec1b5d0369fd466bb7532db30005ab07555eb66411b4720a8e11abf2e37","observation_id":"cf9fb5dd-37db-4f48-bcff-41420203c652","resolution":{"observed_at":"2026-05-10T17:54:03.278501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:aaf35f569a89a278a16c5812ea424c9ad887833b7b8ef5a225cf860193532c2e","observation_id":"289e2685-f9ab-426c-96da-39c594ffe397","resolution":{"observed_at":"2026-05-11T19:21:27.216305Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T15:15:41.249905Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15670","last_updated":"2025-07-25T15:07:10Z","snapshot_observed_at":"2026-08-07T15:10:49.347473Z","submitted_at":"2025-05-21T15:48:30Z","title":"SALM-Duplex: Efficient and Direct Duplex Modeling for Speech-to-Speech Language Model","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:41.249905Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2505.15670"},"observation_digest":"sha256:4a2265ae4bf0d7a6c738afb3cbb7d91a778b7f8f8df76b0a4e3d441435ae9dad","observation_id":"f8de665c-47f6-46ec-bace-b58b78ad2f12","resolution":{"observed_at":"2026-08-07T15:15:41.249905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-08T16:08:45.949013Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T05:27:25.425188Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2505.17589"},"observation_digest":"sha256:55c882e1626bce99c18863684546aa714db655336fe34cc676d126253c31f1ca","observation_id":"5802628b-d704-4ac7-be71-bddc3a1e7dcb","resolution":{"observed_at":"2026-05-16T05:27:25.575517Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T12:27:25.262496Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.24496","last_updated":"2025-05-30T11:47:29Z","snapshot_observed_at":"2026-08-07T23:08:47.920163Z","submitted_at":"2025-05-30T11:47:29Z","title":"Speech Token Prediction via Compressed-to-fine Language Modeling for Speech Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:27:25.262496Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2505.24496"},"observation_digest":"sha256:0d7e8cc077ba83d6ff4070cd8b83d6195b2da01d48f8c85c80e03fbfbd568139","observation_id":"d2aea3f9-24c4-499c-ab07-bcca87572d2a","resolution":{"observed_at":"2026-08-07T12:27:25.262496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T11:37:29.400192Z","title":"Minmo: A multimodal large language model for seamless voice interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01934","last_updated":"2025-06-02T17:53:10Z","snapshot_observed_at":"2026-08-08T01:25:27.640818Z","submitted_at":"2025-06-02T17:53:10Z","title":"RoboEgo System Card: An Omnimodal Model with Native Full Duplexity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:37:29.400192Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2506.01934"},"observation_digest":"sha256:03f655ac9b2156acc2b59f297fa7af71634fa270f291fafbee405054a102ac48","observation_id":"b35f5ec1-0f86-42ca-a4e5-1425f62ae257","resolution":{"observed_at":"2026-08-07T11:37:29.400192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-07T05:47:14.172217Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07081","last_updated":"2025-06-19T09:40:25Z","snapshot_observed_at":"2026-08-07T05:40:25.931166Z","submitted_at":"2025-06-08T10:54:23Z","title":"Streaming Endpointer for Spoken Dialogue using Neural Audio Codecs and Label-Delayed Training","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:14.172217Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2506.07081"},"observation_digest":"sha256:3d68a9a57c756b1231089821a11952ce45a5ca4ffdbd67c65d5b0024e28315a2","observation_id":"0c79f311-4e44-4233-a9bf-7396fc98ea25","resolution":{"observed_at":"2026-08-07T05:47:14.172217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-06T20:17:22.225974Z","title":"MinMo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.03343","last_updated":"2025-07-08T04:19:38Z","snapshot_observed_at":"2026-08-08T04:51:38.021518Z","submitted_at":"2025-07-04T07:10:33Z","title":"SHNU Multilingual Conversational Speech Recognition System for INTERSPEECH 2025 MLC-SLM Challenge","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:17:22.225974Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2507.03343"},"observation_digest":"sha256:aa80833ee6ad36a3fe124a80183544031726db6fd374a3b9275921c8b3a1119a","observation_id":"a47b8e75-4b61-4b57-b1ed-d6e17c8c917d","resolution":{"observed_at":"2026-08-06T20:17:22.225974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-06T19:21:03.998457Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.998457Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:8d5efcf0570a6672413a8e02981140e33ff3ff2199827202b3f7d7ad246942cc","observation_id":"9690060e-f981-4df2-969d-edbf34cee12c","resolution":{"observed_at":"2026-08-06T19:21:03.998457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:d72445649bdd424133415f260e6cc065884b846ba573f74959b4a64a6499921f","observation_id":"6665ef24-3b40-480a-bf0d-30f4124a50d6","resolution":{"observed_at":"2026-05-16T05:59:50.972489Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T17:33:57.014492Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16188","last_updated":"2025-08-27T19:49:56Z","snapshot_observed_at":"2026-08-07T08:50:45.717514Z","submitted_at":"2025-08-22T08:08:45Z","title":"Seeing is Believing: Emotion-Aware Audio-Visual Language Modeling for Expressive Speech Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T17:33:57.014492Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2508.16188"},"observation_digest":"sha256:751e369e988accb820a81caae91359dd849fb4d5fb5d071548b1dde890b19234","observation_id":"835e4410-3f65-4d47-bf3a-bba964b3caf9","resolution":{"observed_at":"2026-08-05T17:33:57.014492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-04T23:33:04.393443Z","title":"Minmo: A multimodal large language model for seamless voice interaction.arXiv preprint arXiv:2501.06282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06502","last_updated":"2025-09-08T10:07:30Z","snapshot_observed_at":"2026-08-06T19:22:29.209698Z","submitted_at":"2025-09-08T10:07:30Z","title":"FireRedChat: A Pluggable, Full-Duplex Voice Interaction System with Cascaded and Semi-Cascaded Implementations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T23:33:04.393443Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2509.06502"},"observation_digest":"sha256:f5fb3824b03f5ac30ccce5a3f02a7e728ddf90079b0f2b1d0c819c40b51efb04","observation_id":"f5052c7e-0f0d-4940-b654-d55c810e0ddf","resolution":{"observed_at":"2026-08-04T23:33:04.393443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:dc896800dc149923d8c8f2aba7ab1f00874c9aa4f9408e6f2885eb111d65bc73","observation_id":"3111c3be-fa8c-4298-9f55-830136d93b89","resolution":{"observed_at":"2026-05-18T11:52:35.659434Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-03T03:46:49.151182Z","title":"InProceed- ings of the 60th Annual Meeting of the Association for Computational Linguistics, pages 5723–5738","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.07106","last_updated":"2026-06-11T12:59:57Z","snapshot_observed_at":"2026-08-03T06:14:40.140346Z","submitted_at":"2026-02-06T18:03:30Z","title":"Ex-Omni: Enabling 3D Facial Animation Generation for Omni-modal Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:46:49.151182Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2602.07106"},"observation_digest":"sha256:6d68450ce5f2934158b0c0b4da49e20b3700ccba79865eeb446713c92204b7f2","observation_id":"d153856f-7e16-4451-80dd-62b539f890d7","resolution":{"observed_at":"2026-08-03T03:46:49.151182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-07-12T20:09:57.922788Z","title":"MinMo: a Multimodal Large Language Model for Seamless V oice Interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14603","last_updated":"2026-06-29T06:44:20Z","snapshot_observed_at":"2026-07-12T20:09:54.804124Z","submitted_at":"2026-04-16T04:21:32Z","title":"A Synonymous Variational Perspective on the Rate-Distortion-Perception Tradeoff","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T20:09:57.922788Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2604.14603"},"observation_digest":"sha256:1fdefc9c4c952281e29d5d250da7d980f1a89e9c30c2225aa656bd9da3cfe055","observation_id":"3084213f-457d-4427-a41e-431578c03d96","resolution":{"observed_at":"2026-07-12T20:09:57.922788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2604.14604","last_updated":"2026-04-16T04:22:11Z","snapshot_observed_at":"2026-08-01T20:57:25.785838Z","submitted_at":"2026-04-16T04:22:11Z","title":"Hijacking Large Audio-Language Models via Context-Agnostic and Imperceptible Auditory Prompt Injection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T11:32:10.126062Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2604.14604"},"observation_digest":"sha256:98a648635f7b867059d924d0f156b9d5931197ea02751f16081d8b293b241782","observation_id":"f87ebdfc-9267-41f8-b353-9a15b04da1a1","resolution":{"observed_at":"2026-05-10T11:35:18.933536Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:b0f9c8c8d152052589469cb91d865b0d599c27169b724596da595599eb89af74","observation_id":"4bd9864a-415f-4561-9c89-e1e4e80f81fd","resolution":{"observed_at":"2026-05-11T19:46:15.309003Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-07-06T23:18:26.864785Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:1c5ba724e056cf31d362752dc7f7b176a02a3596bf6b59e3a0fc1918588e3fac","observation_id":"6e833eaf-2b6b-4a9f-b76d-736e5db9cb9e","resolution":{"observed_at":"2026-05-11T00:50:49.658682Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:6bf23ba3869480ba9a1825c350a5851607304ec527e14f0b7205611d615b62a9","observation_id":"f98c64bc-ba00-4f4c-8738-a43e47c1706f","resolution":{"observed_at":"2026-05-11T04:50:55.814043Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2605.10199","last_updated":"2026-05-11T08:46:47Z","snapshot_observed_at":"2026-07-06T23:22:13.774652Z","submitted_at":"2026-05-11T08:46:47Z","title":"How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T03:08:55.753359Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2605.10199"},"observation_digest":"sha256:a8498831f12410ce8fc9ae7bf9b2e8f155fed9eaed8316b08f8b84189c3bbf1c","observation_id":"bc6f7e98-2b30-46dc-9b13-9ca9073d695e","resolution":{"observed_at":"2026-05-12T03:11:19.082803Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.01016","last_updated":"2026-05-31T05:13:32Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:13:32Z","title":"PolySpeech-100: A Large-Scale Benchmark for Speech Understanding Across 100+ Languages and Dialects","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:44:07.669223Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.01016"},"observation_digest":"sha256:387649b76969b4210b43907e063cf0f5b0f7bea3e9bdd56e16a9568c97a38c09","observation_id":"de3cdd73-cdc7-4589-bf53-8de655a8d4ad","resolution":{"observed_at":"2026-06-28T17:52:27.005157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.06559","last_updated":"2026-06-04T12:39:44Z","snapshot_observed_at":"2026-08-02T15:33:37.373792Z","submitted_at":"2026-06-04T12:39:44Z","title":"IRAF: Interference-Resilient Adaptive Fusion for Noise-Robust End-to-End Full-Duplex Spoken Dialogue Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T23:42:38.203116Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.06559"},"observation_digest":"sha256:8bb6df7f3cfaab42d16a14ba8459ec9bf6d6b87eb4ac016ad4811cca3e15d826","observation_id":"261905a0-a092-4246-8f4c-c7f6c1ffe5ae","resolution":{"observed_at":"2026-07-02T15:37:06.845645Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.11167","last_updated":"2026-06-09T17:46:55Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:46:55Z","title":"Multi-Faceted Interactivity Alignment in Full-Duplex Speech Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T12:53:00.569655Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.11167"},"observation_digest":"sha256:674b88e182300ac23fd6773217579a2d79d9a0c2a6e9134ac52bdf3d9ef351d6","observation_id":"45174887-b8b0-46f6-8832-7439fbf48ad6","resolution":{"observed_at":"2026-06-27T13:20:57.401988Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T05:32:27.371597Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:8aef7e27074290927746cf9af19702c364916453663de6d366c50404268083df","observation_id":"8c92bdd4-85d7-4681-b4cc-64134ed8f291","resolution":{"observed_at":"2026-07-03T16:28:39.528756Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.13544","last_updated":"2026-06-26T09:33:27Z","snapshot_observed_at":"2026-07-06T23:52:18.996096Z","submitted_at":"2026-06-11T16:27:45Z","title":"Adaptive Turn-Taking for Real-time Multi-Party Voice Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:01:44.202712Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.13544"},"observation_digest":"sha256:df4f990b2f214d33027ddc99b19e011d07f3ed938e7479b72c342a4b870e5524","observation_id":"d85abf04-d89f-4a3a-bf8d-9ff602672990","resolution":{"observed_at":"2026-06-29T18:43:51.440118Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.19453","last_updated":"2026-06-17T18:00:08Z","snapshot_observed_at":"2026-07-06T23:54:46.974663Z","submitted_at":"2026-06-17T18:00:08Z","title":"A Survey of Full-Duplex Spoken Dialogue Systems: Architectural Hierarchy, Interaction Ontology, and Decision State Machine","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T19:02:16.119373Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.19453"},"observation_digest":"sha256:c4d03a850a41302102f7480c6adca060977dd9df337a51915bac52af4b71d44d","observation_id":"1c775997-0ae1-4ebb-bcca-133882e01dff","resolution":{"observed_at":"2026-07-04T02:49:24.994509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.30553","last_updated":"2026-06-30T15:48:46Z","snapshot_observed_at":"2026-08-06T15:45:16.008317Z","submitted_at":"2026-06-29T16:49:17Z","title":"COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T03:09:57.069086Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.30553"},"observation_digest":"sha256:732e938b66c8f1ce166d5f6a67edbcc91dbe1a760d6c18c77e436e146fe54e05","observation_id":"0083f0bf-be5f-402f-a7a8-fddd8bc5ad46","resolution":{"observed_at":"2026-06-30T03:14:14.952294Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.30553","last_updated":"2026-06-30T15:48:46Z","snapshot_observed_at":"2026-08-06T15:45:16.008317Z","submitted_at":"2026-06-29T16:49:17Z","title":"COSM: A Cooperative Scheduling Framework for Concurrent PIM and CPU Execution on Mobile Devices","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T06:28:07.670564Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.30553"},"observation_digest":"sha256:e8a9fb47b54bad2fa2bfc6a50e7aa93fb0d3dcbf992ad92d330cc1d9e425bf9d","observation_id":"1cf1750e-18f3-48bc-b49e-15a5843b5a95","resolution":{"observed_at":"2026-07-01T09:35:39.871015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":"2501.06282","doi":"10.48550/arxiv.2501.06282","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chen, Y","venue":"arXiv (Cornell University)","work_id":"50ddf455-deb6-42e9-8eb3-e5808ac7d3d4","year":2024},"citing_paper":{"arxiv_id":"2606.30944","last_updated":"2026-06-29T21:55:18Z","snapshot_observed_at":"2026-08-07T21:37:48.909123Z","submitted_at":"2026-06-29T21:55:18Z","title":"Preserving Speech-to-Text LLM Capabilities in Speech-to-Speech Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T01:01:24.536821Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2606.30944"},"observation_digest":"sha256:920c11fe46c026065062c7d6d6a1b90f7964c0e18dcfdfc4426b4ff3bf499f5d","observation_id":"32763740-303e-4d41-870f-d964311c304e","resolution":{"observed_at":"2026-07-01T13:05:45.810988Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-07-31T23:35:22.292690Z","title":"MinMo: A multimodal large language model for seamless voice interaction.arXiv preprint arXiv:2501.06282, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23938","last_updated":"2026-07-27T02:30:15Z","snapshot_observed_at":"2026-08-06T09:15:17.907620Z","submitted_at":"2026-07-27T02:30:15Z","title":"Qwen-Audio-3.0-TTS: Freely Controllable and Highly Robust Speech Synthesis with Multi-Stage Training Paradigm","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:35:22.292690Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2607.23938"},"observation_digest":"sha256:c3c8a591a117d4fad93157c6863fa10a7fe48e40a885a64aa28032443b8b8829","observation_id":"be3d8eac-f471-4e53-86b3-0a7ecd8971f1","resolution":{"observed_at":"2026-07-31T23:35:22.292690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-03T08:35:47.364591Z","title":"Minmo: A multimodal large language model for seamless voice interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29363","last_updated":"2026-07-31T12:51:24Z","snapshot_observed_at":"2026-08-05T23:15:08.967026Z","submitted_at":"2026-07-31T12:51:24Z","title":"Stable Autoregressive Speech Generation with Low-Frame-Rate High-Dimensional Continuous Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T08:35:47.364591Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2607.29363"},"observation_digest":"sha256:6843b6d5aa6d9d6d692b4c48a1716d9bb78ea44b7c92232c4732e9f651585f96","observation_id":"25b295e9-c9a7-4c43-bf82-ef8fd55297a9","resolution":{"observed_at":"2026-08-03T08:35:47.364591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.06282/citation-record","integrity":"/paper/2501.06282/integrity","json":"/paper/2501.06282/citation-record.json","paper":"/paper/2501.06282"},"outbound":[],"paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 32 inbound Pith citation observations for arXiv:2501.06282."}