{"as_of":"2026-08-20T04:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97aea893e0626557578563e81f481051d04a4b5ee6b172eb5ee23a4831b58289","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:54:19.340049Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T00:49:26.507281Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T19:46:15.325325Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"cited_work":{"arxiv_id":"2507.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"thinking","venue":null,"work_id":"fbda3465-4bbf-479f-ab53-8b96595f6453","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-08T11:00:52.196039Z"},"links":{"cited_paper":"/paper/2507.20091","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:21b475050713fbfa4a19d2467c1523f2fd1095223eb072ee97cb14b669df337d","observation_id":"f56f709b-b828-435b-b0ee-482180d02993","resolution":{"observed_at":"2026-05-11T19:46:15.327083Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"cited_work":{"arxiv_id":"2507.20091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.20091","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"thinking","venue":null,"work_id":"fbda3465-4bbf-479f-ab53-8b96595f6453","year":2025},"citing_paper":{"arxiv_id":"2605.05927","last_updated":"2026-05-08T01:27:50Z","snapshot_observed_at":"2026-08-11T04:20:01.560211Z","submitted_at":"2026-05-07T09:32:05Z","title":"Minimizing Modality Gap from the Input Side: Your Speech LLM Can Be a Prosody-Aware Text LLM","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T00:49:26.507281Z"},"links":{"cited_paper":"/paper/2507.20091","citing_paper":"/paper/2605.05927"},"observation_digest":"sha256:f95c037184f6deb1e9e4a84a141dfb06b8169f09cb9d89ff6a55a61c1d96b037","observation_id":"73a32923-2621-4c7c-9c73-e2c763ebfd53","resolution":{"observed_at":"2026-05-11T00:50:49.643075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20091/citation-record","integrity":"/paper/2507.20091/integrity","json":"/paper/2507.20091/citation-record.json","paper":"/paper/2507.20091"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.095238Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.095238Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:a3b30a7a5903806dfa621b5bb1b106ea583ce882e2d78a7b1f2885193df396b6","observation_id":"dee9aa13-00b1-4644-b147-bbf0eba5df4f","resolution":{"observed_at":"2026-08-15T17:54:19.095238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.101576Z","title":"Dm-codec: Distilling multimodal representations for speech tokenization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.101576Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:73a0c7fb8fe6cf7f114adabe420295b565f1a945899d52c30577bf9080418094","observation_id":"7d4af0ee-20f8-4091-a709-a63d1d3f8468","resolution":{"observed_at":"2026-08-15T17:54:19.101576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-16T20:32:03.446600Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-15T17:54:19.106677Z","title":"dmel: Speech tokenization made simple","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.106677Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d23b635a38c79df7f57e36ac86b24e5dfc3107d19fd8e2de65a797ee18f57cac","observation_id":"c92597f9-8e37-453a-b3f5-2f29d8379e52","resolution":{"observed_at":"2026-08-15T17:54:19.106677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.112745Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.112745Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d25d0c7a82783ec8bc2007f5d8c1780eec7c11155837881583baa755b75f56d8","observation_id":"dddf75bb-7c71-40a6-9544-69c2e8c066c2","resolution":{"observed_at":"2026-08-15T17:54:19.112745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-19T12:40:58.936874Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-15T17:54:19.118430Z","title":"Soundstorm: Efficient parallel audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.118430Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:72d0b9dc6d757cb4333533f4f2d323be279d39f86734baeaa2bf5353174bfdce","observation_id":"6d818c27-e966-48ff-85f2-dccce0497ae0","resolution":{"observed_at":"2026-08-15T17:54:19.118430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.206176Z","title":"Giveness, contrasitiveness, definiteness, subjects, topics, and point of view","venue":null,"work_id":"0bc7261c-e983-4c80-960d-e6cb73a42c6f","year":1976},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.123781Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:cd7687da16bce03ffe5bcca33cae00375679a0f7d287044f9f9a5f86cb3420a0","observation_id":"0e085d97-ffc2-4cef-b51c-8f5fe7d5dae0","resolution":{"observed_at":"2026-08-15T17:54:20.212182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24177","last_updated":"2024-10-31T17:43:13Z","snapshot_observed_at":"2026-08-17T11:16:14.675895Z","submitted_at":"2024-10-31T17:43:13Z","title":"DC-Spin: A Speaker-invariant Speech Tokenizer for Spoken Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24177","snapshot_observed_at":"2026-08-15T17:54:19.129079Z","title":"Dc-spin: A speaker-invariant speech tokenizer for spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.129079Z"},"links":{"cited_paper":"/paper/2410.24177","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:2a7166d67b6b84a26fc966a887b1829d215139f473b0322dc3f11dec0cc90c09","observation_id":"3d1e0e8c-5558-49b9-85ea-5876e630df6e","resolution":{"observed_at":"2026-08-15T17:54:19.129079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04256","last_updated":"2025-01-08T03:47:54Z","snapshot_observed_at":"2026-08-10T21:35:22.314779Z","submitted_at":"2025-01-08T03:47:54Z","title":"DrawSpeech: Expressive Speech Synthesis Using Prosodic Sketches as Control Conditions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04256","snapshot_observed_at":"2026-08-15T17:54:19.134392Z","title":"Drawspeech: Expressive speech synthesis using prosodic sketches as control conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.134392Z"},"links":{"cited_paper":"/paper/2501.04256","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:55d819f11da78a451a681293d9cdee1671512bffa81c20c3e6b1a2a155001860","observation_id":"ccb609e8-ddf5-4482-843d-273d1b8e377a","resolution":{"observed_at":"2026-08-15T17:54:19.134392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14069","last_updated":"2024-10-14T07:57:06Z","snapshot_observed_at":"2026-08-19T05:26:29.129854Z","submitted_at":"2023-12-21T17:47:33Z","title":"EmphAssess : a Prosodic Benchmark on Assessing Emphasis Transfer in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14069","snapshot_observed_at":"2026-08-15T17:54:19.140208Z","title":"Emphassess: a prosodic benchmark on assessing emphasis transfer in speech-to-speech models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.140208Z"},"links":{"cited_paper":"/paper/2312.14069","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d200578eb2fb0f240fbf5fc06644868e35c7ee92d2f12b794d402979f8682d5a","observation_id":"24823737-1366-4758-af51-1ecf7adb7e91","resolution":{"observed_at":"2026-08-15T17:54:19.140208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-15T17:54:19.145484Z","title":"High fidelity neural audio compression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.145484Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7e1686daf57c25ab96fe07fe18861dbadd98a3a259df96bd241f0fef9faec542","observation_id":"713a6d3e-8e89-452f-9f2a-83960024e07b","resolution":{"observed_at":"2026-08-15T17:54:19.145484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-15T17:54:19.150827Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.150827Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:54f3cb3bb69e89d12c31f384f569a9e96998511466618b92c15223c94e85d3ea","observation_id":"7fccdd45-b965-454c-8f5b-97c77fc1e9f2","resolution":{"observed_at":"2026-08-15T17:54:19.150827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.190762Z","title":"Elevenlabs voice generation platform","venue":null,"work_id":"e85e30e2-acb0-4fc4-b9fb-51c710c9bce5","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.156119Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:efd39788ed5a9b5729b535b07054c40ab43465882c563e7713579742c86ecfe5","observation_id":"e274388a-c2c9-48b9-8754-7b5b1eedbe3c","resolution":{"observed_at":"2026-08-15T17:54:20.195688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.161618Z","title":"Recent advances in discrete speech tokens: A review","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.161618Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:869a09f6400761b909c5970accfa646907a221d4109547d8aff0be6db9a7b1aa","observation_id":"5612812a-b60a-4f0a-9d37-dae60a462b24","resolution":{"observed_at":"2026-08-15T17:54:19.161618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.166411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.166411Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:0f9bf666862f6bbe816d23b709f90358a0fa98d6bc50e06c72ef63dbca771888","observation_id":"b0d96cdc-cac7-4247-9e64-4290d0ad8f7d","resolution":{"observed_at":"2026-08-15T17:54:19.166411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-15T17:54:19.171625Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.171625Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7b429ed742fb5e6e66a4b1369885bee3b9aac70d6b55705b9d18f7022583bf84","observation_id":"285c13b6-7cfc-4155-a2fc-72d0f0da6136","resolution":{"observed_at":"2026-08-15T17:54:19.171625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-17T17:21:34.645323Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-15T17:54:19.176618Z","title":"Repcodec: A speech representation codec for speech tokenization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.176618Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:b79fd63b20a2ba8d4aa1f9801207ce3d5825b89c3997dba93dc8f9c6f843f1da","observation_id":"b2f588c9-eb8b-47b3-8819-c41769fd9cdc","resolution":{"observed_at":"2026-08-15T17:54:19.176618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.165165Z","title":"Crossing the uncanny valley of conversational voice, 2025","venue":null,"work_id":"9add4b0b-5ec0-482a-93ec-374268f57a00","year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.181649Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:9d06971c199ae99b1957af2b981dad33847ed7bd099774087288e9f5c70d15c6","observation_id":"73502204-a433-4ace-8bee-40ce7176eac5","resolution":{"observed_at":"2026-08-15T17:54:20.170020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.186416Z","title":"An open source emotional speech corpus for human robot interaction applications","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.186416Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:3f81c68a781ce3b4299a54527722b07ace36c5603e77c5691e4331617dc27cb8","observation_id":"357c6328-21d4-44b9-a094-d50b74a4d917","resolution":{"observed_at":"2026-08-15T17:54:19.186416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03637","last_updated":"2024-10-28T01:29:04Z","snapshot_observed_at":"2026-08-19T03:51:35.887560Z","submitted_at":"2024-06-05T22:17:47Z","title":"Style Mixture of Experts for Expressive Text-To-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03637","snapshot_observed_at":"2026-08-15T17:54:19.191217Z","title":"Style mixture of experts for expressive text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.191217Z"},"links":{"cited_paper":"/paper/2406.03637","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:53ca959e00246e14adffb38d9ab10c009cabc5b877efae14e2590205c7dcbb89","observation_id":"e25b62d3-fec4-4b4c-aa00-4d0ed08db09c","resolution":{"observed_at":"2026-08-15T17:54:19.191217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-16T13:22:55.356873Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-15T17:54:19.196492Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.196492Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d83c0d29f954079f2404518ea5417e8dec3c7098c00823624f63434a11248321","observation_id":"4c2ec780-f37a-4266-a023-2e9471ff796d","resolution":{"observed_at":"2026-08-15T17:54:19.196492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.201637Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.201637Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:0167d2abe39dd0ee5685bb7e77f777157e6e41c216f5655d9d353cc2dae968e5","observation_id":"b7da3462-7686-40ce-81f2-9586298d6314","resolution":{"observed_at":"2026-08-15T17:54:19.201637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05706","last_updated":"2024-11-28T01:10:49Z","snapshot_observed_at":"2026-08-16T14:20:12.870542Z","submitted_at":"2024-02-08T14:35:09Z","title":"Paralinguistics-Aware Speech-Empowered Large Language Models for Natural Conversation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05706","snapshot_observed_at":"2026-08-15T17:54:19.206278Z","title":"Paralinguistics-aware speech-empowered large language models for natural conversation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.206278Z"},"links":{"cited_paper":"/paper/2402.05706","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:d5ef117e0584e6c31c25e068c84f029e247f2638b3b564f04ab8be79170872a5","observation_id":"8995600a-5152-4815-b6a7-4fd51b794054","resolution":{"observed_at":"2026-08-15T17:54:19.206278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.211165Z","title":"On generative spoken language modeling from raw audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.211165Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:4958ec3d872c5229701c693658b75f283c9d1d52d4355cb77665be8e70dd17d9","observation_id":"d243f73c-5256-410b-8999-06111fd74af7","resolution":{"observed_at":"2026-08-15T17:54:19.211165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.120514Z","title":"Whisma: A speech-llm to perform zero-shot spoken language understanding","venue":null,"work_id":"d7780312-e659-4681-bf6d-cf02916294e0","year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.215741Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:0b4f16034bbac5185deb19ebda10dabb3307d94d8a939f56d7fb87d4f8c5c108","observation_id":"b6e6aa01-e127-43e4-b570-f2ed7cc28c2f","resolution":{"observed_at":"2026-08-15T17:54:20.125620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.104577Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":"001441d5-4f72-4a42-8594-48e03c15e124","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.220379Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:a1ce5fabaee0a1ae625b33934fe7ba69afd69e782430e0cc79f63310ba5d192e","observation_id":"f5543cb5-b5ab-4813-95be-6a0a387dfe0b","resolution":{"observed_at":"2026-08-15T17:54:20.109798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.089163Z","title":"Generative spoken dialogue language modeling","venue":null,"work_id":"309043c0-faf0-4adb-ad5f-1d60cbc126bf","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.225998Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:58b37a4ce671b3bcdbcffe4610b38abf44157679d5e5e6ed48a54e7a5d008bee","observation_id":"dae726de-a84f-464e-a818-55039915a068","resolution":{"observed_at":"2026-08-15T17:54:20.094079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.073178Z","title":"Spirit-lm: Interleaved spoken and written language model","venue":null,"work_id":"fb79c7ff-c3c2-4b4f-93c4-defdc357ceac","year":2025},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.230893Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:4e3506db42af0d0757040812110df9d737466ea29abdb3faa38aa8b63b6c28e5","observation_id":"f05a6762-2cf0-4e7b-a310-5d3613d603ee","resolution":{"observed_at":"2026-08-15T17:54:20.078237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18603","last_updated":"2025-07-10T17:52:43Z","snapshot_observed_at":"2026-08-16T12:59:56.684198Z","submitted_at":"2024-12-24T18:56:46Z","title":"Long-Form Speech Generation with Spoken Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18603","snapshot_observed_at":"2026-08-15T17:54:19.236403Z","title":"Long-form speech generation with spoken language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.236403Z"},"links":{"cited_paper":"/paper/2412.18603","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:f779f1e6657c9224f08568feb9d00bdec41fa6172b6d2764eb64974150c5eba4","observation_id":"1da4e900-f7a8-4349-9c57-8b093de1d1f8","resolution":{"observed_at":"2026-08-15T17:54:19.236403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.241198Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.241198Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:45ff05a99eb83c3ecd07d62de7b0cb132263807bf90fdb14ab61de88a54fe7a1","observation_id":"d9db9bdc-d2cf-4d6a-bbd2-6002769aedf8","resolution":{"observed_at":"2026-08-15T17:54:19.241198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.047764Z","title":"Prosospeech: Enhancing prosody with quantized vector pre-training in text-to-speech","venue":null,"work_id":"9449af8b-0ff5-4e4d-91db-ac07d096562d","year":2022},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.246565Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:03b4c17452547a8d60cc0a9f5e61000c0c6489a3d62d5b642c8c8edd773fd036","observation_id":"912c46e5-47a8-4262-a262-cbcd8c6d09ab","resolution":{"observed_at":"2026-08-15T17:54:20.052853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-15T17:54:19.251401Z","title":"Audiopalm: A large language model that can speak and listen","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.251401Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:21e8d56751d4b56cbdc05661024d9d7b0bccf0c06f413045c8f806553ac8054c","observation_id":"8c198c27-1d04-46e8-90d3-e93b341966b3","resolution":{"observed_at":"2026-08-15T17:54:19.251401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.031759Z","title":"Shechtman, S","venue":null,"work_id":"84676c07-da8e-4379-b9b2-b0f53a53dc25","year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.256580Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:dd5ee0d62087fe31cfd3fcbe47a50ec96e5f3ba4f603809478a042bdb188d999","observation_id":"57f1eb8c-049b-4b88-b50c-66b3bf03ffe1","resolution":{"observed_at":"2026-08-15T17:54:20.036673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-16T15:39:31.485174Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-15T17:54:19.261079Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.261079Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:ec3cf38d5280afebc9698086281bba1cb6215d628fe944ab58cbbc7a0b32e2f5","observation_id":"6fd81e2d-7668-4d24-bc95-5e4ec3d86d5b","resolution":{"observed_at":"2026-08-15T17:54:19.261079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:20.013146Z","title":"An analysis of the use of qualifications on the amazon mechanical turk online labor market","venue":null,"work_id":"c6bc29af-22c0-4d1d-9885-a846eb0abc9f","year":2017},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.266649Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:1920cdc5364f48b2f6a75b916a9b1c7141db66bf59fc3fe92540baa0c69cdb7c","observation_id":"5d103bf7-035d-42bb-9beb-54c4f55b5afa","resolution":{"observed_at":"2026-08-15T17:54:20.020204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03701","last_updated":"2024-09-10T14:45:15Z","snapshot_observed_at":"2026-08-16T13:20:59.520858Z","submitted_at":"2024-09-05T16:57:39Z","title":"LAST: Language Model Aware Speech Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03701","snapshot_observed_at":"2026-08-15T17:54:19.271586Z","title":"Last: Language model aware speech tokenization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.271586Z"},"links":{"cited_paper":"/paper/2409.03701","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:4702255e18ed3775166942c72459830ca1383c0389fa5cb64272364ee0a3d1f5","observation_id":"5e32e358-db83-4460-8e6b-db9fff747a62","resolution":{"observed_at":"2026-08-15T17:54:19.271586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T17:54:19.277804Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.277804Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:48e98a90c551b78503d36259f63a303f0489b3b5d0e6f6723f17399f3d168020","observation_id":"b94787c0-2378-45a2-b9a6-351247b3a200","resolution":{"observed_at":"2026-08-15T17:54:19.277804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-16T13:03:42.737566Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-15T17:54:19.282895Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.282895Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:68e09f3f79eec7ec2a7328ca90a7eed3c4479ade3718710aab80c6b3304ba96d","observation_id":"c4e6ed73-6450-4012-9043-9e684426521a","resolution":{"observed_at":"2026-08-15T17:54:19.282895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-08-16T13:22:50.721442Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-15T17:54:19.288620Z","title":"Mini-omni: Language models can hear, talk while thinking in streaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.288620Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:6085a28a5a6c6910b06a762de186e91a0093e33ea5de377af8202db6a64e89f8","observation_id":"20da324c-57e1-408d-81d9-26b3b92de506","resolution":{"observed_at":"2026-08-15T17:54:19.288620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10763","last_updated":"2023-05-18T07:07:04Z","snapshot_observed_at":"2026-08-16T15:32:06.418190Z","submitted_at":"2023-05-18T07:07:04Z","title":"CLAPSpeech: Learning Prosody from Text Context with Contrastive Language-Audio Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10763","snapshot_observed_at":"2026-08-15T17:54:19.293507Z","title":"Clapspeech: Learning prosody from text context with contrastive language-audio pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.293507Z"},"links":{"cited_paper":"/paper/2305.10763","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:3c1f1a21aab0c240e81e411d4642413f503fee2b9b67714b3d348e636829bf34","observation_id":"0ccb4176-9e30-49ea-9647-bda5a5e460e9","resolution":{"observed_at":"2026-08-15T17:54:19.293507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.298375Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.298375Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:20cefeb5686c8f2e9370f402895fae12119817c122831f824c4bb699ec72fbdd","observation_id":"f66ab1d4-1d32-4423-afed-fe1d397bd964","resolution":{"observed_at":"2026-08-15T17:54:19.298375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-12T12:50:46.995038Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-15T17:54:19.303523Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.303523Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:54b767be2bb07f611af8f34c42a966856ec1139175145e21405f0b91520fa906","observation_id":"fe38e239-0e49-4449-b1f2-25255f4a6132","resolution":{"observed_at":"2026-08-15T17:54:19.303523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-19T05:24:09.876190Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-15T17:54:19.309151Z","title":"Scaling speech-text pre-training with synthetic interleaved data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.309151Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:2e5b6fc42514fccdd030183deceab58a00bf4036fbcf033bbe4ae9ce20d55ad9","observation_id":"f1f7c4c5-f1e1-4549-af60-efd7686a3e4c","resolution":{"observed_at":"2026-08-15T17:54:19.309151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-19T05:23:55.031463Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-15T17:54:19.319277Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.319277Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:30d4f8a408df91e38b4847410e3050535a2b5e6432236cc68a0e41cad8b25e4d","observation_id":"5b3a6cc5-aa00-47a4-b7af-0fbc3876389c","resolution":{"observed_at":"2026-08-15T17:54:19.319277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-16T15:04:18.834535Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-15T17:54:19.324529Z","title":"Speechtokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.324529Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7a2fd77ccd5c36fc8cae514508214fc5ecdcc430fc4a095e765a3949ad896cea","observation_id":"be3cf178-6cc1-4782-80f5-95f27d530a18","resolution":{"observed_at":"2026-08-15T17:54:19.324529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.330235Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.330235Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:2e7a3cf9599057416e1e835cf35e6350d8d30f71aab51ab2183c5a72fa1cef1c","observation_id":"5429ead6-1b82-4c58-b02b-1dea3c8f39f5","resolution":{"observed_at":"2026-08-15T17:54:19.330235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.335195Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.335195Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:7a2f770504de4604b0af291e77ada6a9ad0b752284cbca885b03e34b97f02040","observation_id":"1c77e3bb-9bf3-4d61-80c0-397382e4feb9","resolution":{"observed_at":"2026-08-15T17:54:19.335195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:19.340049Z","title":"One key desirable capability for speech language models is the ability to capture the intricate interdependency between content and prosody","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T17:54:19.340049Z"},"links":{"citing_paper":"/paper/2507.20091"},"observation_digest":"sha256:2c2b0cdef7179ec1ba361f0771a0fbc3dd7b5beb20d1d4ba48a44ac959ffea99","observation_id":"db04fd29-6e89-4cdd-9c95-6c6bac061f78","resolution":{"observed_at":"2026-08-15T17:54:19.340049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20091","last_updated":"2025-08-07T23:23:12Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:05:27.212882Z","submitted_at":"2025-07-27T00:59:01Z","title":"ProsodyLM: Uncovering the Emerging Prosody Processing Capabilities in Speech Language Models"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2507.20091."}