{"as_of":"2026-08-10T23:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6ff0165398e5aa86eaebd110b934fb7a6bfdf0aebfe3616dd925cb090fd012b1","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T20:02:51.447632Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:28:53.249841Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T11:28:53.249841Z","title":"A preliminary exploration with gpt-4o voice mode","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02443","last_updated":"2025-06-03T05:02:14Z","snapshot_observed_at":"2026-08-09T15:38:03.456563Z","submitted_at":"2025-06-03T05:02:14Z","title":"Breaking the Barriers of Text-Hungry and Audio-Deficient AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T11:28:53.249841Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.02443"},"observation_digest":"sha256:9a4ac8fd8bb9a2b0759938eb16a1ca73f994ca8d696855f58dc8ada477d07b1f","observation_id":"0222dac1-65b2-4a42-b3f4-ba5a3b496eda","resolution":{"observed_at":"2026-08-07T11:28:53.249841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T10:28:40.942515Z","title":"A preliminary exploration with gpt-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-09T05:46:01.132153Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.942515Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1db2af4196cfef37471d04295837ce883f352c5aed1e596e56202140b6ae21e1","observation_id":"63a5ae1d-f3b6-4eb2-8f1b-02d5633e1e7e","resolution":{"observed_at":"2026-08-07T10:28:40.942515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T05:43:08.435473Z","title":"A preliminary exploration with gpt-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07294","last_updated":"2025-08-16T22:33:43Z","snapshot_observed_at":"2026-08-09T01:52:11.151345Z","submitted_at":"2025-06-08T21:36:10Z","title":"Towards Generalized Source Tracing for Codec-Based Deepfake Speech","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:43:08.435473Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.07294"},"observation_digest":"sha256:fd4e780321662d2da4ecadd27fbe394ea63378bdb30bf9fb728c6cf1ae46b7e3","observation_id":"bab67a9a-cbc5-4ae2-a27f-821dd93357a5","resolution":{"observed_at":"2026-08-07T05:43:08.435473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T10:17:46.980945Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":208,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.980945Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:714b92d28d3f191b24892140f010dcf9955e76fe5c5de75535ee517d7e24d5a3","observation_id":"7e20f3cb-0194-4c2e-9f4e-30aa19a240bd","resolution":{"observed_at":"2026-08-07T10:17:46.980945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2510.00626","last_updated":"2026-04-26T15:50:39Z","snapshot_observed_at":"2026-07-06T22:31:20.110402Z","submitted_at":"2025-10-01T07:59:45Z","title":"When Silence Matters: The Impact of Irrelevant Audio on Text Reasoning in Large Audio-Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T11:08:08.916893Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2510.00626"},"observation_digest":"sha256:8345aa22a14feae12d1b52aaea3b0f31f03d335ab01ad2d57bb781ab8e2a26f4","observation_id":"68ec82f6-b36f-4b8a-a48c-6ad95da979b8","resolution":{"observed_at":"2026-05-18T11:11:17.870042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2512.23578","last_updated":"2026-04-16T00:22:32Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T16:23:54Z","title":"Style Amnesia: Investigating Speaking Style Degradation and Mitigation in Multi-Turn Spoken Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T19:26:30.384474Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2512.23578"},"observation_digest":"sha256:592667473d9a396328a7ffdd1ddd3c07dd41f4a263c0eebb87cf357ec838f15e","observation_id":"fa56d9ba-6427-47f9-997d-c19382bb01b9","resolution":{"observed_at":"2026-05-16T19:28:20.154420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:45.214298Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2604.10065"},"observation_digest":"sha256:77eb026163539a8c2db8f51d288f2b4b8c91119b25001533f40119e5c12157c8","observation_id":"b4d92f47-b149-4acb-bda9-9f8c2e7888d7","resolution":{"observed_at":"2026-05-11T07:35:58.745428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-08-09T14:11:12.127362Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:f4a6fa48210f051ea44ba9123ed107471606b9c5f7d5bd2ee4556252d4ddd625","observation_id":"2a7258c4-95a8-4b3f-9e9f-a4f17429687a","resolution":{"observed_at":"2026-05-11T23:16:36.175798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2606.21933","last_updated":"2026-06-20T08:00:12Z","snapshot_observed_at":"2026-08-02T09:30:55.390588Z","submitted_at":"2026-06-20T08:00:12Z","title":"ISCSLP 2026 CoT-TTS Challenge: Chain-of-Thought Reasoning for Context-Aware Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T11:33:32.067771Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2606.21933"},"observation_digest":"sha256:5e75a1ad59cda3bb0996e9b4529814bdd74e45d5e98ad0f6e589fbb0962abcad","observation_id":"8f148614-e12b-440d-8fc7-495f8f1f40f2","resolution":{"observed_at":"2026-07-04T08:29:42.197627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":"2502.09940","doi":"10.48550/arxiv.2502.09940","metadata_source":"pith","pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A preliminary exploration with gpt-4o voice mode","venue":"cs.CL","work_id":"2473cd1d-7c86-46cb-aa17-1cbff7848bb9","year":2025},"citing_paper":{"arxiv_id":"2607.06540","last_updated":"2026-07-07T17:43:36Z","snapshot_observed_at":"2026-08-07T11:01:55.500168Z","submitted_at":"2026-07-07T17:43:36Z","title":"Hierarchical Acoustic-Semantic Modeling: Modality Separation and Semantic Coherence for Full-Duplex SLMs","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-08T02:38:31.073805Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2607.06540"},"observation_digest":"sha256:888d128cf7ac80bc0647f352a8947b89881ad5ff4442d57fa3cdfbd9c083d4ad","observation_id":"21f6f1e5-7025-4737-8c84-c0a4aed49abd","resolution":{"observed_at":"2026-07-08T02:44:27.576608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:54.918255+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-07-14T03:05:43.100032Z","title":"A preliminary exploration with GPT-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11801","last_updated":"2026-07-13T16:53:08Z","snapshot_observed_at":"2026-08-01T19:49:31.431715Z","submitted_at":"2026-07-13T16:53:08Z","title":"Encoder-Side Neuron Identification and Amplification for Acoustic Perception in Large Audio-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T03:05:43.100032Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2607.11801"},"observation_digest":"sha256:705a702d3505f4178d09df27bafd58e276bfac6d61b544019ce01373314d183a","observation_id":"b40423e5-fe69-42c1-84b8-3cdb4d8f8380","resolution":{"observed_at":"2026-07-14T03:05:43.100032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09940/citation-record","integrity":"/paper/2502.09940/integrity","json":"/paper/2502.09940/citation-record.json","paper":"/paper/2502.09940"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T20:02:51.293384Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.293384Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:43722193a81d3918ccc0b733658092cf885c4b206ca77a604a2c61aa5aea7980","observation_id":"3d7b9238-d897-4944-9000-d0126d5d7ae5","resolution":{"observed_at":"2026-08-07T20:02:51.293384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T20:02:51.299697Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.299697Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:66c4855cc44209639fbd978f9e86276f764e54ba800b2127113909bcda1ccf63","observation_id":"c7c4f458-20b9-42e6-a43b-2c1309aa8a79","resolution":{"observed_at":"2026-08-07T20:02:51.299697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T20:02:51.305293Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.305293Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:7ff40308be9a1a92184ed4d74b04baa89d74b40109d5ca764a295c5178645321","observation_id":"6c30636a-ffaf-49f1-8a65-cd9052182336","resolution":{"observed_at":"2026-08-07T20:02:51.305293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18062","last_updated":"2024-07-25T14:17:56Z","snapshot_observed_at":"2026-08-09T11:26:54.015185Z","submitted_at":"2024-07-25T14:17:56Z","title":"Audio Entailment: Assessing Deductive Reasoning for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18062","snapshot_observed_at":"2026-08-07T20:02:51.311209Z","title":"Audio entailment: Assessing deductive reasoning for audio understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.311209Z"},"links":{"cited_paper":"/paper/2407.18062","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:df8754487f4424d42c8e604c25137171f9a0a9ec3ae81f1906f331e66836c6ae","observation_id":"34da2de4-288e-48f0-9fb2-dc35f5362924","resolution":{"observed_at":"2026-08-07T20:02:51.311209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T20:02:51.316910Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.316910Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:01fd64313eec3ac73bc5166a407fd4efcd55a6e28ece5dbda507fccaea94bc45","observation_id":"abd63aac-4a2c-415c-a107-d79b76c623d7","resolution":{"observed_at":"2026-08-07T20:02:51.316910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T20:02:51.322585Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.322585Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:ad701b55ea3a6c7915db36f2658a6384f74e1e871760262fc504f6d796a6db81","observation_id":"d54a85f0-f0cb-403c-84be-bf3409720cca","resolution":{"observed_at":"2026-08-07T20:02:51.322585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-09T20:04:27.847882Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-07T20:02:51.327669Z","title":"Wavllm: Towards robust and adaptive speech large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.327669Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:dbfcfa82f0c98b8880a5a026de3eabbe54ec0854374c89ba2b9bf74dd16924fd","observation_id":"b680d517-637c-45a4-abb2-09fcb9126e8c","resolution":{"observed_at":"2026-08-07T20:02:51.327669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05361","last_updated":"2025-06-09T16:36:12Z","snapshot_observed_at":"2026-08-10T19:46:16.386898Z","submitted_at":"2024-11-08T06:33:22Z","title":"Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05361","snapshot_observed_at":"2026-08-07T20:02:51.333001Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.333001Z"},"links":{"cited_paper":"/paper/2411.05361","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:a82664eaad4d386f51f811ea6d7330f50ef4bbea66b2567928ca74eff8e883a7","observation_id":"effb8c2d-a8ee-4f4b-ad31-ee6a915cf8df","resolution":{"observed_at":"2026-08-07T20:02:51.333001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.337588Z","title":"Dynamic-superb: Towards a dynamic, collaborative, and comprehensive instruction-tuning benchmark for speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.337588Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:f0c0d32d409e0a20f31469bad8c7a7c6a816bce3d115b393a00bb368882111cf","observation_id":"3bdbe4d1-afcd-4684-ba4e-9453112f679c","resolution":{"observed_at":"2026-08-07T20:02:51.337588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.961391Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":"94c52d43-96c1-4b3f-bf78-a78f16f9ee61","year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.341839Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:f2e175f0e54ecabdefbb6580300ba1c0c33225eba2b18922646edc32ea3fd57c","observation_id":"a183cfae-44ac-4211-a996-8cb3c8c1d6ec","resolution":{"observed_at":"2026-08-07T20:02:51.967440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T20:02:51.346414Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.346414Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:e4d26de713d71c82ee6968a9b165e2391e0b1be7caba777c77b019841454ebdb","observation_id":"c3dc2f48-93e4-4aa5-8bfd-0802688e9f02","resolution":{"observed_at":"2026-08-07T20:02:51.346414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.943207Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"522c7e2f-b599-483d-ba65-39bebfa0e14e","year":2020},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.351641Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:0b08f550d8751afdae1d84bf6dfbe3143f426646712e974882a44ee108cf441f","observation_id":"a1466721-f129-4e76-8e47-4798cfe722b4","resolution":{"observed_at":"2026-08-07T20:02:51.948517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.926636Z","title":"Speech-copilot: Leveraging large language models for speech processing via task decomposition, modularization, and program generation","venue":null,"work_id":"9f1e71b2-36fa-4784-9cd1-e92320cdfefc","year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.358132Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:56cb7a857b1aaa14c854555ac019de99472c1412967d548311ffdabb5235e182","observation_id":"a0e53dda-3bef-4995-a635-8299557f7578","resolution":{"observed_at":"2026-08-07T20:02:51.932030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.910832Z","title":"Rlaif vs","venue":null,"work_id":"8bb51158-778d-4295-8982-13969897978c","year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.362848Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:b1b21a7a8bf9881dde8af33114b3d1a2c73df200532b25f02d0ff3fe74e4702d","observation_id":"34d53109-097c-4089-a55a-918649780fc9","resolution":{"observed_at":"2026-08-07T20:02:51.915608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-07-06T19:34:46.714277Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-07T20:02:51.368119Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.368119Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:4eca325bb77f5c6f83a187ea3e44bf23a64a0ae8fb81e0aa90f44fb64f0c7df5","observation_id":"459e9243-efca-474f-a464-1109ebd917f7","resolution":{"observed_at":"2026-08-07T20:02:51.368119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01834","last_updated":"2025-05-27T16:17:52Z","snapshot_observed_at":"2026-07-06T19:44:38.954993Z","submitted_at":"2024-11-04T06:07:53Z","title":"Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01834","snapshot_observed_at":"2026-08-07T20:02:51.373586Z","title":"Align-slm: Textless spoken language models with reinforcement learning from ai feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.373586Z"},"links":{"cited_paper":"/paper/2411.01834","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:6fa8e7c13f416d0246853ca92a72f6c59ecfe112b9db99ec3ed58fa74149f094","observation_id":"9004b082-8752-4404-b008-c3399c7284ce","resolution":{"observed_at":"2026-08-07T20:02:51.373586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.895731Z","title":"Music understand- ing llama: Advancing text-to-music generation with question answering and captioning","venue":null,"work_id":"70910b9e-98cf-45ce-a08a-c96ce2fc0f39","year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.378576Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:1fa046cda53697cb3fcd664aaf171868c85fc078df1867ed1f368aa393d19c99","observation_id":"84a253a0-e7b3-4268-8b80-ebdd7e881cf8","resolution":{"observed_at":"2026-08-07T20:02:51.900311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.878069Z","title":"Generative spoken dialogue language modeling","venue":null,"work_id":"3b2250fc-98ae-459d-a201-9e578e7ac3b0","year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.383104Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:af095aa98f1d8181912eac181cc8bbc8f1b8df591b9199b6aef8c06c1309f83e","observation_id":"82df58b9-b994-42e6-82d3-15658f617028","resolution":{"observed_at":"2026-08-07T20:02:51.883317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T20:02:51.387812Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.387812Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:114033754d5300b5133501a6c55ace0ea30c3486c63941d0abbb122bb627f0c8","observation_id":"0982cda7-00bd-4a80-8fda-55c2e3ca948a","resolution":{"observed_at":"2026-08-07T20:02:51.387812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.392746Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.392746Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:9e807cf3098e609f0060f86a7d4132405a9a3ef1322d819677cf978e02034643","observation_id":"756a0851-4d08-4190-87d0-abef841af903","resolution":{"observed_at":"2026-08-07T20:02:51.392746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-07T20:02:51.397575Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.397575Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:7cd643359fa4ffe93ebb8dcdcf51bc8729a9964581c330a28c007b0b2001f685","observation_id":"4e2dadb6-6cfd-4124-b8f1-492cf28c22bd","resolution":{"observed_at":"2026-08-07T20:02:51.397575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.851253Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"77a0ab02-9388-472d-99d9-bf0af4bb1b57","year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.402731Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:afd675cbf5ab726399b1a084dc497733a66a6b9d1f14e0b1ea46a3b085f2e62c","observation_id":"bfe556de-7c3b-4923-b474-696c96ee8271","resolution":{"observed_at":"2026-08-07T20:02:51.856487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T20:02:51.407438Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.407438Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:3c11ea7bf2ac0ca3bfe21e5194124aba49760f55853dadb9362db1f099b388a7","observation_id":"c8af6ec6-5620-4688-836b-3fb8d915d8ea","resolution":{"observed_at":"2026-08-07T20:02:51.407438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T20:02:51.412615Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.412615Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:7a1d4a479adeccc2d2c6f9d03fae1a915f8bf62d6b3dc2b24cf3a0fa2b454a67","observation_id":"66ae2e73-8b63-42ed-8ed6-697fe324dfca","resolution":{"observed_at":"2026-08-07T20:02:51.412615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T20:02:51.417456Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.417456Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:ec1da5d6f469686fb1b953c6623b2da71e608c82ee0064206028e7d6541df578","observation_id":"268babd2-4d67-45e0-8765-793c569cb80c","resolution":{"observed_at":"2026-08-07T20:02:51.417456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.835112Z","title":"Hear: Holistic evaluation of audio representations","venue":null,"work_id":"a608bb98-fb50-4124-893b-0f94c3262a5f","year":2021},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.422484Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:0147af7fcf7f50e47d60c3f5dfc5159a3c0703a97f6d7c73c92c1ca786c69332","observation_id":"a3bfebef-9fda-4a34-99d3-064e69857a8e","resolution":{"observed_at":"2026-08-07T20:02:51.840052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.819339Z","title":"Lin, Andy T","venue":null,"work_id":"f02bb820-34ad-44c6-a266-552b16bd2172","year":2021},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.427417Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:e51a961e3629e0685a5711dfb30c4464c8bd82c4c1c0acff8ca32397f47a3e50","observation_id":"76c2b940-f58a-4690-9095-1e6e74d0fdd6","resolution":{"observed_at":"2026-08-07T20:02:51.824406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T20:02:51.432863Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.432863Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:835d35b516712308ca78617abf792c29d04e442176e4c7295aab2d6f77e90ce2","observation_id":"f7532d53-d73b-4e03-81d0-3dd53e235e36","resolution":{"observed_at":"2026-08-07T20:02:51.432863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T20:02:51.800102Z","title":"Marble: Music audio representation benchmark for universal evaluation","venue":null,"work_id":"ce591bd4-4ed7-4574-894d-2f3ec3b332aa","year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.437832Z"},"links":{"citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:abf50da16148a67a2e75be863ffe3b926858cd999310db57061e1170bd053099","observation_id":"df5261ba-9ff7-49f2-87df-6dfbafda82cc","resolution":{"observed_at":"2026-08-07T20:02:51.807163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T20:02:51.442638Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.442638Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:5d3f3c70feb1a97f3374c4df4b4657e0eb7dca936ee3091acf19ad57efb5074b","observation_id":"0d2d38f4-6f1f-45b4-a054-2146e245cb87","resolution":{"observed_at":"2026-08-07T20:02:51.442638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05600","last_updated":"2024-04-08T15:21:17Z","snapshot_observed_at":"2026-08-05T11:57:00.393189Z","submitted_at":"2024-04-08T15:21:17Z","title":"SpeechAlign: Aligning Speech Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05600","snapshot_observed_at":"2026-08-07T20:02:51.447632Z","title":"Speechalign: Aligning speech generation to human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T20:02:51.447632Z"},"links":{"cited_paper":"/paper/2404.05600","citing_paper":"/paper/2502.09940"},"observation_digest":"sha256:5d6d996becaa5ba91a3d7ee26b6dcd817c68ee104218940e7f1f6fb2346d38e9","observation_id":"bf9f291e-1e32-4e63-8d09-6d3267b7679b","resolution":{"observed_at":"2026-08-07T20:02:51.447632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T19:45:52.146308Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 11 inbound Pith citation observations for arXiv:2502.09940."}