{"as_of":"2026-08-10T07:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd3cc1bf2485675369cf72ba38443846a460f1c0bbf977e010887e2f3b4fc5a9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:29:06.241559Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:e94c8939151a2760e334490e3365b86b2534914ae40805882f12e3ddca6f695b","observation_id":"ded06926-e606-4b56-a2ba-23eb7a8141fe","resolution":{"observed_at":"2026-05-22T20:45:08.060933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T15:29:06.241559Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15000","last_updated":"2025-05-21T01:07:00Z","snapshot_observed_at":"2026-08-07T15:23:25.479987Z","submitted_at":"2025-05-21T01:07:00Z","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:06.241559Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2505.15000"},"observation_digest":"sha256:54676cf755973cf537f31c96b90ab9caf7f57ca63ab7ac1c178073d0ca6485e5","observation_id":"776258d4-e59f-4fe8-a55e-cb813b7dfa3a","resolution":{"observed_at":"2026-08-07T15:29:06.241559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T14:51:15.984529Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17417","last_updated":"2025-05-23T03:05:47Z","snapshot_observed_at":"2026-08-10T04:48:50.903321Z","submitted_at":"2025-05-23T03:05:47Z","title":"Speechless: Speech Instruction Training Without Speech for Low Resource Languages","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:51:15.984529Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2505.17417"},"observation_digest":"sha256:0844660c1d8a0d5e3719aee61d093ab37e86b9e68da46a2d1f2b89be8cd0e405","observation_id":"8b62c3c8-bdc0-46e4-bea0-2e93f641eeb5","resolution":{"observed_at":"2026-08-07T14:51:15.984529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T14:34:18.428449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18436","last_updated":"2025-07-04T23:16:29Z","snapshot_observed_at":"2026-08-08T14:59:05.608435Z","submitted_at":"2025-05-24T00:11:07Z","title":"Voice of a Continent: Mapping Africa's Speech Technology Frontier","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:18.428449Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2505.18436"},"observation_digest":"sha256:4d9849055927fb39179e3ebec772a4401845949c7a5abcd65670c94ab83d4aca","observation_id":"361d5b18-6658-4d8a-b318-2349c31d9196","resolution":{"observed_at":"2026-08-07T14:34:18.428449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2506.03610","last_updated":"2026-04-14T22:54:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-04T06:40:33Z","title":"Orak: A Foundational Benchmark for Training and Evaluating LLM Agents on Diverse Video Games","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-19T12:01:42.681135Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.03610"},"observation_digest":"sha256:fb8fec8dda78b9abf01e8d58c4d9af9cf13a2a1f9e5b0b535f0bade64ad974b3","observation_id":"63c5ade6-2bbe-4a47-bec2-2bbe12f9f813","resolution":{"observed_at":"2026-05-19T12:02:16.643857Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T05:03:11.869766Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.869766Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:2407919a83d8b1a3278da203ab09db33d014d51c6682d10d9d216c3d149707ba","observation_id":"41695169-4cb5-48d0-8092-c55a769324ee","resolution":{"observed_at":"2026-08-07T05:03:11.869766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T10:39:47.340916Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11086","last_updated":"2025-06-05T06:21:28Z","snapshot_observed_at":"2026-08-09T08:48:18.617444Z","submitted_at":"2025-06-05T06:21:28Z","title":"Intelligibility of Text-to-Speech Systems for Mathematical Expressions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:39:47.340916Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.11086"},"observation_digest":"sha256:805aaf559843d966a918a6858bec89a49b27d85851083a63dea64827c2d2e131","observation_id":"038a4d0f-3d1f-4eb3-8280-74bcfe506cac","resolution":{"observed_at":"2026-08-07T10:39:47.340916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T23:35:36.004978Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17611","last_updated":"2025-06-21T06:30:59Z","snapshot_observed_at":"2026-08-07T23:23:01.221709Z","submitted_at":"2025-06-21T06:30:59Z","title":"OpusLM: A Family of Open Unified Speech Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:35:36.004978Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.17611"},"observation_digest":"sha256:c418cb01a6524a7e12de5b94af0fab0850e512f9412bc29876ff01e2424ce52e","observation_id":"bb72e72e-eb31-46a0-8cd5-6748b6f876b0","resolution":{"observed_at":"2026-08-06T23:35:36.004978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T19:06:00.999223Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06507","last_updated":"2025-07-14T07:46:11Z","snapshot_observed_at":"2026-08-08T04:13:41.618907Z","submitted_at":"2025-07-09T03:13:08Z","title":"GR-LLMs: Recent Advances in Generative Recommendation Based on Large Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:00.999223Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2507.06507"},"observation_digest":"sha256:3528b7985a7a88f4d90ad2b0571a1e89cac6c906baf045e7bc6f2ed817e2f5f6","observation_id":"9037fce0-afe2-4dc2-b1df-ea9ddf694be3","resolution":{"observed_at":"2026-08-06T19:06:00.999223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-06T16:47:34.319918Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-08T13:02:50.918593Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.319918Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:6b9483ffee239d0bfcb99efd1fed332b2df7924aeec54c51b45f258f530e6a7b","observation_id":"1020d1a2-ec69-4a76-8428-208b2c7a54f9","resolution":{"observed_at":"2026-08-06T16:47:34.319918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T16:46:48.070568Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17863","last_updated":"2025-08-25T10:16:07Z","snapshot_observed_at":"2026-08-09T22:28:55.202566Z","submitted_at":"2025-08-25T10:16:07Z","title":"Speech Discrete Tokens or Continuous Features? A Comparative Analysis for Spoken Language Understanding in SpeechLLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:46:48.070568Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2508.17863"},"observation_digest":"sha256:f22737cfae3d6a22d4584b73d7440a033d4bc7f6a192a02c1fc3ed5c5f2e0c3c","observation_id":"b90e7ae5-32b0-4904-aa3f-5e5b23cb3264","resolution":{"observed_at":"2026-08-05T16:46:48.070568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T12:14:52.274618Z","title":"Recent advances in speech language models: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01814","last_updated":"2025-09-01T22:44:57Z","snapshot_observed_at":"2026-08-08T16:53:03.431005Z","submitted_at":"2025-09-01T22:44:57Z","title":"Mic Drop or Data Flop? Evaluating the Fitness for Purpose of AI Voice Interviewers for Data Collection within Quantitative & Qualitative Research Contexts","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T12:14:52.274618Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2509.01814"},"observation_digest":"sha256:2955070e0526225536f187e53ff63e422f129e755d7bac4568ad5e17a86048c2","observation_id":"7082b871-1105-4515-aeb9-7af8f2c182b1","resolution":{"observed_at":"2026-08-05T12:14:52.274618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T11:25:29.124574Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02859","last_updated":"2025-09-02T22:11:29Z","snapshot_observed_at":"2026-08-05T11:25:28.709116Z","submitted_at":"2025-09-02T22:11:29Z","title":"Speech DF Arena: A Leaderboard for Speech DeepFake Detection Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:25:29.124574Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2509.02859"},"observation_digest":"sha256:c654369635f7e9a3db8ee9ffa3016a8c9ef4eea1c5a4c06b87f041e60ec3cded","observation_id":"bb42877f-23b2-493b-9ed0-d2a644d69623","resolution":{"observed_at":"2026-08-05T11:25:29.124574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2509.08031","last_updated":"2026-05-11T14:29:23Z","snapshot_observed_at":"2026-08-05T09:03:01.095551Z","submitted_at":"2025-09-09T15:30:40Z","title":"AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:01.257126Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2509.08031"},"observation_digest":"sha256:1128f882bd1e8eee691e04c947108d8cca963b585cbe1b126d94a29512569af2","observation_id":"098c0c90-6348-4246-8634-a424d1abd924","resolution":{"observed_at":"2026-05-18T18:11:43.169892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2510.06201","last_updated":"2026-05-04T15:09:53Z","snapshot_observed_at":"2026-08-06T05:09:49.220327Z","submitted_at":"2025-10-07T17:54:12Z","title":"TokenChain: A Discrete Speech Chain via Semantic Token Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T09:14:58.542628Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2510.06201"},"observation_digest":"sha256:1cecdd12879714c31d3207963d0f731d8aa63c7d80a9deac986147285806ed07","observation_id":"f4569ce4-5a72-4073-a5ad-9e98464af008","resolution":{"observed_at":"2026-05-18T09:16:09.482195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2510.09592","last_updated":"2026-05-10T15:21:35Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:50:59Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T07:43:23.913399Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2510.09592"},"observation_digest":"sha256:03367ce2431502ac75db3c9f0f5b3349464d48707723bb47afcf3e81a29dc121","observation_id":"70a23ab9-d3d9-4e3b-a5a1-5a7e2e7923d0","resolution":{"observed_at":"2026-05-18T07:46:03.599452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2511.20657","last_updated":"2026-05-02T12:09:38Z","snapshot_observed_at":"2026-08-08T11:08:10.889384Z","submitted_at":"2025-10-11T07:40:36Z","title":"Intelligent Agents with Emotional Intelligence: Current Trends, Challenges, and Future Prospects","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-18T08:11:31.181704Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2511.20657"},"observation_digest":"sha256:dc06a3878ac540b949249a5d200c939eb72fe938418228d78ca3bb35f7b62d0c","observation_id":"a159f64d-02d7-402d-9b29-77da7e49d8cd","resolution":{"observed_at":"2026-05-18T08:12:30.166907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-15T08:34:56.898815Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:a8b013e4574ce15174885e393e39eee1e7a9d83761658d533ad8cef87d68a48d","observation_id":"f096af3e-4743-424b-9274-f767bba495c4","resolution":{"observed_at":"2026-05-15T08:35:18.429430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T10:43:27.176535Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:ebff5c7d3d3c12958ff9571189a9a47fd5d9af7a962c0330d498e80bfc2c6b76","observation_id":"0134ecc2-d108-4441-9734-5a020a491d06","resolution":{"observed_at":"2026-05-21T10:44:07.790794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-07-13T22:57:11.059962Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.17837","last_updated":"2026-06-04T13:47:38Z","snapshot_observed_at":"2026-08-02T07:45:21.753896Z","submitted_at":"2026-03-18T15:30:29Z","title":"The Silent Thought: Modeling Internal Cognition in Full-Duplex Spoken Dialogue Models via Latent Reasoning","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T22:57:11.059962Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2603.17837"},"observation_digest":"sha256:2cb611d9b0349284027cc98f3cefb3c4b7de705af23682c2aab9bfb6aeb6c0c6","observation_id":"3434c926-3507-48f9-9abf-af20e547d63a","resolution":{"observed_at":"2026-07-13T22:57:11.059962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2604.13067","last_updated":"2026-03-19T21:12:49Z","snapshot_observed_at":"2026-08-05T17:09:57.300771Z","submitted_at":"2026-03-19T21:12:49Z","title":"From Seeing it to Experiencing it: Interactive Evaluation of Intersectional Voice Bias in Human-AI Speech Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T07:59:22.416259Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2604.13067"},"observation_digest":"sha256:7791b5f7169bd74d17151c227699585360a8fc01baffda6d3ef6885bf0d43392","observation_id":"94d926ba-c1c5-4cd3-8ec3-617393cf85f5","resolution":{"observed_at":"2026-05-15T07:59:50.641103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":"2410.03751","doi":"10.48550/arxiv.2410.03751","metadata_source":"arxiv_reference","pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751","venue":"arXiv (Cornell University)","work_id":"f00839a5-7958-4b3f-a510-746f20ca6ffd","year":2024},"citing_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-07T09:43:33.557408Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T10:03:54.653164Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2605.28480"},"observation_digest":"sha256:ab2d26f5f309afe22a82d1e7fc1c3ef01c69ad4f0debc86f822cd5a74441712a","observation_id":"c94f2c74-304e-43c0-a0a7-0e9a07fef51c","resolution":{"observed_at":"2026-06-29T10:13:17.598343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-01T05:50:28.242656Z","title":"Recent advances in speech language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22100","last_updated":"2026-07-24T08:52:44Z","snapshot_observed_at":"2026-08-08T14:23:38.469443Z","submitted_at":"2026-07-24T08:52:44Z","title":"MEUSLI: a Multilingual Projector for LLM-based ASR and Beyond","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T05:50:28.242656Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2607.22100"},"observation_digest":"sha256:73cef2f000fdd3e8d1489ad055174435bd7549a92e053396632de040c9bb6bf1","observation_id":"eadf26e4-da33-4572-955a-55ef64290ebb","resolution":{"observed_at":"2026-08-01T05:50:28.242656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.03751/citation-record","integrity":"/paper/2410.03751/integrity","json":"/paper/2410.03751/citation-record.json","paper":"/paper/2410.03751"},"outbound":[],"paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2410.03751."}